AI 語音模型初創公司 Fish Audio 宣佈完成 5000 萬美元 種子輪融資,本輪由 Coreline VenturesCapital Today 領投,359 Capital、Parable、Play Time、Alphalist Partners、Bayhouse Ventures、Carya Venture Partners 及 HF0 等機構跟投。該公司總部位於加州帕洛阿爾託,由前輝達研究員 Shijia Liao 創立,最初僅是一個小專案——他因不滿市場上合成語音缺乏表現力,用單張 GPU 訓練了一個語音生成模型並開源。如今,其 GitHub 倉庫 Fish Speech 已獲得超過 3.1 萬顆星,被獨立開發者、遊戲設計師和創作者廣泛使用。

自去年上線以來,Fish Audio 已擁有超過 800 萬 使用者(使用其開源或託管版本),並實現 2100 萬美元 的年經常性收入(ARR)。公司累計釋出了 5 款模型,包括 4 個語音生成模型和 1 個語音轉文本模型。其中 3 個語音生成模型已開源,但最新的 S2.1 Pro 模型僅通過付費 API 提供。Fish Audio 的語音庫包含超過 1.5 萬種 自然語言控制選項,能夠滿足從創意內容到企業客服、銷售運營等不同場景對語音表現力和可控性的需求。

在商業化方面,Fish Audio 提供面向創作者和團隊的月度付費套餐,解鎖一定時長的語音生成分鐘數及聲音克隆功能。同時,公司也推出了企業版 API 和平台,據稱 HeyGenSanasPlaud 等組織已在採用其技術。CEO 兼聯合創始人 Rissa Cao 表示,不同企業有不同偏好:例如 HeyGen 用其語音驅動 AI 虛擬形象,注重真實感;遊戲工作室需要富有表現力的角色聲音;而 LiveKit 等語音代理公司則追求更自然、低延遲且適合通話的語音。

Fish Audio 構建語音庫的方式之一是邀請使用者提交自己的聲音用於訓練,並對被採用的聲音提供補償。然而,這一做法曾引發爭議——數月前,部分創作者指控自己的聲音在未經同意的情況下被上傳至平台。雖然公司設有 DMCA 內容下架流程,但處理耗時較長。Cao 表示,公司現已自動化下架流程,創作者只需提交簡短語音樣本或合同證明所有權,其聲音將在 3 分鐘 內從平台移除。不過,這仍無法完全防止他人未經授權上傳藝術家的聲音,直到藝術家發現並申請下架前,其聲音仍可能被使用。

Coreline Ventures 合夥人 Oskue Honda 指出,社群驅動模式只有在創作者信任平台時才能成為持久優勢,這意味著同意、透明度和歸屬必須內置於產品中,而非事後補救。他認為行業需要走向經過驗證的聲音所有權、清晰的許可條款、便捷的舉報和下架流程,並最終實現創作者在聲音被商業使用時獲得收益分成的模式。

Cao 透露,當公司僅以開源專案形式面向創作者時,運營高效且不需要外部資金。但隨著投資者興趣升溫,公司希望開發更先進的模型並服務企業客戶,因此決定尋求融資。未來,Fish Audio 計劃今年釋出一款音訊理解模型,並正在構建語音到語音模型。

AI 語音生成賽道競爭激烈,參與者包括 ElevenLabsWellSaidCartesiaSpeechifyAsync(原 Podcastle)Krisp 等。359 Capital 合夥人 Rico Mallozzi 認為,為開發者提供精細的控制以及成本高效的模型訓練,將幫助 Fish Audio 與大型 AI 實驗室競爭。他表示,Fish Audio 以現有團隊構建出頂尖模型,展現了其在縮小人工語音與人類語音差距方面的技術實力。