字節跳動於7月20日正式釋出音訊創作模型Seed Audio 1.0,該模型的核心能力在於通過一段提示詞即可生成包含對白、音效和環境聲的完整聲音場景,無需拼接多個模組。據官方介紹,Seed Audio 1.0支援多音訊要素協同生成、音色風格控制以及多語種自然表達,並能在長音訊中保持角色一致性。

在智東西的實際體驗中,Seed Audio 1.0展現了較強的場景理解與聲音編排能力。例如,輸入一段描述加油站懸疑場景的提示詞,模型生成了包含熒光燈嗡鳴、冰櫃壓縮機低響、貨車駛過等環境音,以及兩名男子緊張與散漫的對話,整體氛圍營造到位。在古風武俠場景測試中,模型不僅還原了密林風聲、狼嚎、箭矢穿透等音效,還保持了角色蘇晚和沈硯在音色與情緒上的一致性,未出現角色漂移。

聲音模仿是Seed Audio 1.0的另一亮點。在測試中,模型無需額外訓練,僅憑一段新聞聯播女聲參考音訊,就能用該音色生成《甄嬛傳》中甄嬛的台詞,聲音辨識度較高。此外,模型還支援多語種生成,在粵語茶餐廳對話測試中,它還原了瓷碗碰撞、風扇轉動等背景音效,對話語氣和節奏把握較好,但初始部分仍有一定AI感。

官方評測資料顯示,Seed Audio 1.0在盲測主觀偏好CMOS打分中,相較頭部商用音訊服務最高提升0.79,使用者更偏好其生成音訊。在電影、短劇、播客、動畫等十餘類場景測試中,模型生成的整體音訊可用率達91%。多語種能力方面,模型支援20餘種語言生成,絕大多數語種人聲自然度MOS平均分超4分(≥4分為優質標準)。

Seed Audio 1.0還具備時間線控制能力,支援100ms級時間精度,能將角色、台詞、情緒和音效按時間線編排,適用於影視翻配等場景。同時,模型支援零樣本音訊生成,創作者既可用文字描述目標聲音,也可結合參考音訊控制生成結果,無需為每種聲音單獨訓練模型。例如,同一音色在不同場景下可呈現足球解說的高亢激昂、有聲書的平穩敘述或直播帶貨的快速強調。

從行業視角看,Seed Audio 1.0的釋出標誌著AI音訊從單一語音合成向複雜場景創作的跨越。過去,AI音訊模型多聚焦於文本轉語音或簡單音效生成,而Seed Audio 1.0嘗試將對白、音效、環境聲和情緒表達統一到同一生成框架中,使AI能夠理解完整聲音場景。隨著模型對聲音結構、角色一致性和時間控制能力的增強,AI音訊正從輔助工具走向內容生產環節。未來,如何讓生成聲音進一步接近真人表達,並滿足更復雜的創作需求,將是音訊大模型持續探索的方向。