网易有道在AI Open Day发布会上开源两款同传模型——子曰4-R2T2与子曰4-T3PO,均具备流式输出能力,主打极低时延与高流畅度的实时同传体验。与此同时,有道还发布了AI原生语音Agent网易叭哥说,以及办公Agent应用LobsterAI 2.0。
两款开源模型分工明确。子曰4-R2T2是一款低延迟、高精度的真流式自动语音识别(ASR)模型,平均延迟仅200至600毫秒。有道称,在多项benchmark中,该模型的延迟与识别质量均达到开源模型中的最先进水平,与闭源模型相比也不逊色。其训练采用稳定前缀数据、强制时间对齐数据和词元级音频分割等数据构建技术,并结合最长稳定前缀(LSP)学习范式,使模型在流式输出设计下仍保持较高的离线识别准确率。
子曰4-T3PO则是一款拥有140亿参数的文本到文本同步机器翻译(SiMT)模型。有道团队通过高质量分段对齐数据构建、翻译模型流式冷启动以及基于帕累托感知的强化学习完成训练。该模型同样采用全流式输出,用户可调节延迟模式,在不同使用场景下从低延迟到高质量之间切换。它还能与外部流式ASR模型联动,实现语音到文本的实时转换。现场演示了一段超快语速的实时翻译,两款模型组合下语音被快速清晰地译为中文。
新发布的网易叭哥说被定位为网易首个AI原生语音Agent,思路是“从语音转文字走向语音转意图”。它在语音识别之后继续做语义理解,把口语中的重复、停顿、改口整理为可直接使用的文字,可用于聊天、邮件、文档等场景。产品支持100多种语言的实时语音翻译,有道称在计算机、金融、医学等领域翻译准确率可达98%以上。该产品承诺终身免费,声音仅在本地处理,不上传、不记录,也不用于模型训练。目前Mac与Windows桌面端已全量上线,移动端仍在开发中。
口语学习产品Hi Echo累计用户突破1000万,此次升级为Agent口语私教,采用端到端全双工语音对话,支持随时打断,并能识别对话中的语气与情绪。系统从首次对话开始评估用户水平,据此生成学习计划并动态调整,底层为有道自研的Helix目标驱动型自进化学习系统。场景覆盖口语考试、商务谈判与求职面试,新版将在下周上线应用市场。有道同时宣布与雅思官方达成合作,Hi Echo成为BC雅思官方模拟测评系统首家全面合作伙伴。
办公Agent方面,LobsterAI是国内首个100%开源的桌面级办公Agent,今年2月19日发布。截至目前,其用户规模突破100万,活跃用户次日留存超80%,人均每日token消耗超2000万,GitHub Star超6000,累计发布79个版本。2.0版本最大变化是生态兼容,全面兼容OpenClaw 2.0,底座同步升级,该版本有900多位贡献者、1.6万个PR。新增的Sites功能让Agent生成结果可一键拥有公网可访问地址并支持分享码;Teams功能面向团队协作,取消席位费,只按实际用量收费。
据网易有道CEO周枫现场披露,有道AI同传累计服务用户超过2500万,使用次数同比增长近一倍。他在采访中提到,LobsterAI与同类产品最大的不同在于开源、不锁定生态,可对任何应用开放适配;网易用户群体也呈现年轻化特征。周枫还表示,公司目前关注学习、工作和广告营销三大方向,其中广告营销业务已占公司近一半,但此次新发布暂未涉及该业务线。
从行业视角看,有道此次发布集中在学习与工作两大场景,把模型能力进一步向Agent形态延伸。开源同传模型若能持续保持低延迟与高准确率,将降低实时语音翻译、会议记录、语音助手等应用的开发门槛,对语音交互赛道的竞争格局形成影响。不过,从技术能力到规模化应用,仍要看真实工作流中的任务完成率、用户使用频次以及由此形成的商业价值。这些产品能否从单点体验进入高频工作场景,将是验证这套AI布局的重要指标。