Fish Audio:情绪可控的 AI 语音克隆平台,15 秒音频复刻一个声音

Fish Audio

官方背景

Fish Audio 是 Hanabi AI 旗下的 AI 语音生成平台,是 ElevenLabs 之外最受欢迎的替代之一,靠自研 OpenAudio S1 与旗舰 S2 Pro 文本转语音模型打天下——在 2026 年盲测 TTS 评测里名列前茅。它用行内情绪标签(angry、sad、excited、whispering)生成超低延迟、可控情绪的语音,约 15 秒参考音频就能克隆一个声音,支持 30+ 语言。

核心能力

情绪可控 TTS:用 inline 情绪标签让朗读带态度,适合角色配音、动画短片、游戏 NPC;② 极速声音克隆:约 15 秒参考音频生成可复用音色,付费档有更高保真度的专业克隆槽位;③ 30+ 语言(英/中/日/韩/法/德/西/阿),一个声音做多语本地化;④ 专业音频处理:降噪、响度均衡、音质增强;⑤ 语音转文字(多说话人 + 情绪标签);⑥ Voice Agent 实时对话栈 + Story Studio 有声书;⑦ 低延迟 REST API(Python/JS SDK),按输入文本量计费。

应用场景

YouTube 解说、有声书、播客、短剧/漫剧旁白的 AI 配音;克隆个人/品牌声音做一致叙事;用 API 给语音 Agent、App、内部自动化供能;把内容本地化到 30+ 语言。注意:克隆声音需你拥有录制权或明确授权;公开声音库不一定适合所有商用,商用前核对条款。

定价与可及性

免费层每月 8000 credits(约 7 分钟生成)、3 个公开声音槽、增强克隆,限个人非商用。Plus $11/月(年付)25 万 credits、API 接入、10 个私有声音槽、商用授权;Pro $75/月 200 万 credits、3 席、5 个专业克隆槽;Max $749/月 重负载;企业定制。API 按文本量计费(s2-pro $15/百万 UTF-8 字节,约 18 万英文词≈12 小时语音);中文等非拉丁脚本每字符字节更多、更费。访问 fishaudio.org。

立即体验 Fish Audio →

Fish Audio · Fish Audio 是 Hanabi AI 旗下的 AI 语音生…

© 版权声明
THE END
喜欢就支持一下吧
点赞113 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容