AI 语音模型初创公司 Fish Audio 宣布完成 5000 万美元 种子轮融资,本轮由 Coreline VenturesCapital Today 领投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 及 HF0 等机构跟投。该公司总部位于加州帕洛阿尔托,由前英伟达研究员 Shijia Liao 创立,最初仅是一个小项目——他因不满市场上合成语音缺乏表现力,用单张 GPU 训练了一个语音生成模型并开源。如今,其 GitHub 仓库 Fish Speech 已获得超过 3.1 万颗星,被独立开发者、游戏设计师和创作者广泛使用。

自去年上线以来,Fish Audio 已拥有超过 800 万 用户(使用其开源或托管版本),并实现 2100 万美元 的年经常性收入(ARR)。公司累计发布了 5 款模型,包括 4 个语音生成模型和 1 个语音转文本模型。其中 3 个语音生成模型已开源,但最新的 S2.1 Pro 模型仅通过付费 API 提供。Fish Audio 的语音库包含超过 1.5 万种 自然语言控制选项,能够满足从创意内容到企业客服、销售运营等不同场景对语音表现力和可控性的需求。

在商业化方面,Fish Audio 提供面向创作者和团队的月度付费套餐,解锁一定时长的语音生成分钟数及声音克隆功能。同时,公司也推出了企业版 API 和平台,据称 HeyGenSanasPlaud 等组织已在采用其技术。CEO 兼联合创始人 Rissa Cao 表示,不同企业有不同偏好:例如 HeyGen 用其语音驱动 AI 虚拟形象,注重真实感;游戏工作室需要富有表现力的角色声音;而 LiveKit 等语音代理公司则追求更自然、低延迟且适合通话的语音。

Fish Audio 构建语音库的方式之一是邀请用户提交自己的声音用于训练,并对被采用的声音提供补偿。然而,这一做法曾引发争议——数月前,部分创作者指控自己的声音在未经同意的情况下被上传至平台。虽然公司设有 DMCA 内容下架流程,但处理耗时较长。Cao 表示,公司现已自动化下架流程,创作者只需提交简短语音样本或合同证明所有权,其声音将在 3 分钟 内从平台移除。不过,这仍无法完全防止他人未经授权上传艺术家的声音,直到艺术家发现并申请下架前,其声音仍可能被使用。

Coreline Ventures 合伙人 Oskue Honda 指出,社区驱动模式只有在创作者信任平台时才能成为持久优势,这意味着同意、透明度和归属必须内置于产品中,而非事后补救。他认为行业需要走向经过验证的声音所有权、清晰的许可条款、便捷的举报和下架流程,并最终实现创作者在声音被商业使用时获得收益分成的模式。

Cao 透露,当公司仅以开源项目形式面向创作者时,运营高效且不需要外部资金。但随着投资者兴趣升温,公司希望开发更先进的模型并服务企业客户,因此决定寻求融资。未来,Fish Audio 计划今年发布一款音频理解模型,并正在构建语音到语音模型。

AI 语音生成赛道竞争激烈,参与者包括 ElevenLabsWellSaidCartesiaSpeechifyAsync(原 Podcastle)Krisp 等。359 Capital 合伙人 Rico Mallozzi 认为,为开发者提供精细的控制以及成本高效的模型训练,将帮助 Fish Audio 与大型 AI 实验室竞争。他表示,Fish Audio 以现有团队构建出顶尖模型,展现了其在缩小人工语音与人类语音差距方面的技术实力。