
这家 AI 音频初创公司于 7 月 29 日推出其 S2.1 Pro 语音模型,称该模型可通过 5 秒样本克隆声音,并已被多家公司投入生产使用。
Fish Audio 表示,公司已完成 5200 万美元种子轮融资,但未披露投资方,并于 7 月 29 日推出其新一代语音生成模型 S2.1 Pro。该公司称,其开源及托管文本转语音产品的用户总数已超过 800 万,年度经常性收入已达 2100 万美元。Fish Audio 开发语音合成模型,通过可下载软件和面向开发者的托管应用程序接口 (API),将书面文本转换为自然语音。公司表示,其 Fish-Speech 和 S2 模型系列支持超过 80 种语言;而于 2026 年 3 月发布的早期 S2 和 S2 Pro 模型,在基准测试中的词错误率分别为中文 0.54%、英文 0.99%。Fish Audio 表示,S2.1 Pro 可通过 5 秒样本克隆声音,运行速度约为 Cartesia 的两倍,成本约为 ElevenLabs 的六分之一,并已被 HeyGen、LiveKit、Retell、Sanas 和 OpenArt 用于生产环境。该公司还曾表示,在 2025 年另一轮 3000 万美元风险投资融资后,其估值已达到 5 亿美元。