Fish Audio完成5200万美元种子轮融资,ARR达2100万美元

Fish Audio完成5200万美元种子轮融资,ARR达2100万美元

这家 AI 音频初创公司于 7 月 29 日推出其 S2.1 Pro 语音模型,称该模型可通过 5 秒样本克隆声音,并已被多家公司投入生产使用。

事实核查
核心说法已获 Fish Audio X 官方公告和 TechCrunch 原始报道证实:完成 $52M 种子轮融资、ARR 达到 $21M,并公开发布 S2.1 Pro。该模型可基于 5-second 样本克隆声音,且已被 HeyGen、LiveKit 和 Retell 等公司用于生产环境。唯一不准确之处在于发布时间:官方帖子和 TechCrunch 均将公告日期标注为 2026 年 7 月 28 日,而非 7 月 29 日。一些二手信息聚合平台(CryptoBriefing)将金额四舍五入为 $50M,但原始及官方来源确认金额为 $52M。鉴于融资规模、ARR、模型能力和生产环境使用情况均属准确,仅日期相差一天,因此该说法很可能属实。
摘要

Fish Audio 表示,公司已完成 5200 万美元种子轮融资,但未披露投资方,并于 7 月 29 日推出其新一代语音生成模型 S2.1 Pro。该公司称,其开源及托管文本转语音产品的用户总数已超过 800 万,年度经常性收入已达 2100 万美元。Fish Audio 开发语音合成模型,通过可下载软件和面向开发者的托管应用程序接口 (API),将书面文本转换为自然语音。公司表示,其 Fish-Speech 和 S2 模型系列支持超过 80 种语言;而于 2026 年 3 月发布的早期 S2 和 S2 Pro 模型,在基准测试中的词错误率分别为中文 0.54%、英文 0.99%。Fish Audio 表示,S2.1 Pro 可通过 5 秒样本克隆声音,运行速度约为 Cartesia 的两倍,成本约为 ElevenLabs 的六分之一,并已被 HeyGen、LiveKit、Retell、Sanas 和 OpenArt 用于生产环境。该公司还曾表示,在 2025 年另一轮 3000 万美元风险投资融资后,其估值已达到 5 亿美元。

术语与概念
  • 文本转语音: 利用合成语音将书面文本转换为口语音频的技术
  • 托管应用程序接口 (API): 一种基于云的接口,使开发者能够将公司的语音软件集成到自身应用中
  • 语音克隆: 通过短音频样本重建个人声音,以用于合成语音生成的过程