字节跳动于7月20日正式发布音频创作模型Seed Audio 1.0,该模型的核心能力在于通过一段提示词即可生成包含对白、音效和环境声的完整声音场景,无需拼接多个模块。据官方介绍,Seed Audio 1.0支持多音频要素协同生成、音色风格控制以及多语种自然表达,并能在长音频中保持角色一致性。
在智东西的实际体验中,Seed Audio 1.0展现了较强的场景理解与声音编排能力。例如,输入一段描述加油站悬疑场景的提示词,模型生成了包含荧光灯嗡鸣、冰柜压缩机低响、货车驶过等环境音,以及两名男子紧张与散漫的对话,整体氛围营造到位。在古风武侠场景测试中,模型不仅还原了密林风声、狼嚎、箭矢穿透等音效,还保持了角色苏晚和沈砚在音色与情绪上的一致性,未出现角色漂移。
声音模仿是Seed Audio 1.0的另一亮点。在测试中,模型无需额外训练,仅凭一段新闻联播女声参考音频,就能用该音色生成《甄嬛传》中甄嬛的台词,声音辨识度较高。此外,模型还支持多语种生成,在粤语茶餐厅对话测试中,它还原了瓷碗碰撞、风扇转动等背景音效,对话语气和节奏把握较好,但初始部分仍有一定AI感。
官方评测数据显示,Seed Audio 1.0在盲测主观偏好CMOS打分中,相较头部商用音频服务最高提升0.79,用户更偏好其生成音频。在电影、短剧、播客、动画等十余类场景测试中,模型生成的整体音频可用率达91%。多语种能力方面,模型支持20余种语言生成,绝大多数语种人声自然度MOS平均分超4分(≥4分为优质标准)。
Seed Audio 1.0还具备时间线控制能力,支持100ms级时间精度,能将角色、台词、情绪和音效按时间线编排,适用于影视翻配等场景。同时,模型支持零样本音频生成,创作者既可用文字描述目标声音,也可结合参考音频控制生成结果,无需为每种声音单独训练模型。例如,同一音色在不同场景下可呈现足球解说的高亢激昂、有声书的平稳叙述或直播带货的快速强调。
从行业视角看,Seed Audio 1.0的发布标志着AI音频从单一语音合成向复杂场景创作的跨越。过去,AI音频模型多聚焦于文本转语音或简单音效生成,而Seed Audio 1.0尝试将对白、音效、环境声和情绪表达统一到同一生成框架中,使AI能够理解完整声音场景。随着模型对声音结构、角色一致性和时间控制能力的增强,AI音频正从辅助工具走向内容生产环节。未来,如何让生成声音进一步接近真人表达,并满足更复杂的创作需求,将是音频大模型持续探索的方向。