谷歌DeepMind于8月12日推出大规模多语言手语转文本(SL2T)翻译模型,并率先将其接入Pixel 11手机上的谷歌输入法Gboard和实时转写应用Live Transcribe,首批支持将美国手语翻译成英文。这是谷歌首次将手语AI从实验室引入消费产品,用户可以直接对手机打手语,用于搜索网页、撰写消息或文档,以及向Gemini提问和交代任务。

据谷歌介绍,SL2T的训练过程使用了超过10万小时的数据,覆盖50多种手语,其中约四分之一为美国手语数据。谷歌表示,将不同手语、方言及不同熟练程度的使用者放在一起训练,有助于模型学习共享的底层结构,实验效果优于单语模型。在美国手语到英文翻译的FLEURS-ASL测试中,SL2T的零样本BLEURT得分达到70,谷歌称其为迄今为止最强大的手语翻译模型,明显高于此前公开结果。

与语音转写相比,手语翻译面临两项核心挑战。首先,语音转写是在同一种语言中,将声音按顺序映射为文字;而手语是拥有独立语法和词汇的自然语言,需要真正的机器翻译,而非按顺序将手势逐一转换成单词。其次,模型需要学会“看见”并理解身体动作,手语通过手、手臂、躯干、头部和面部同时发生的动作传递含义,在高帧率下准确追踪这些动作是难度和计算量都很高的计算机视觉任务。

为了保护隐私,SL2T不会将原始摄像头画面直接发送到服务器。手机端的MediaPipe Holistic模型会先追踪用户身体上的关键点,仅将相应的几何坐标发送至服务器进行翻译,原始视频可以立即丢弃。SL2T会将这些坐标序列直接转换成文字,不需要经过手语翻译研究中常用的中间标注。谷歌认为,直接翻译可以更好地处理面部动作和空间结构等信息,同时摆脱人工标注的词汇范围限制。

全球共有超过200种手语,约7000万聋人及听障人士使用这些语言。借助SL2T,用户可以像使用语音输入一样,直接对手机打手语输入文字。例如,用户可以用手语搜索网页、撰写消息或文档,也可以向Gemini提问或要求其执行任务。在Live Transcribe中,用户可以直接用手语回复对话,无需双方反复打字。谷歌称,测试用户认为使用美国手语输入比输入英文更快、更自然。

谷歌还针对流式翻译延迟、非手语输入引发的幻觉、左撇子及单手打手语等真实场景进行了优化。不过,模型仍可能在罕见手势、快速手指拼写、被动语态、空间描述和缺乏上下文的时态判断中出错。

谷歌表示,聋人社区参与了SL2T从构想、数据收集到用户测试和影响评估的整个过程。公司还成立了AI手语顾问委员会(AISLAC),邀请全球聋人组织和相关专家参与制定产品开发重点,并共同发布SL2T 1.0影响报告。

SL2T的进展不仅体现在训练数据规模和基准测试成绩上,更重要的是,它已经进入输入法和实时转写等实际使用场景,让手语像语音一样成为手机输入方式。不过,SL2T首批仅支持美国手语到英文的翻译,在罕见手势、快速手指拼写、空间描述和时态判断等方面仍会出错。后续,谷歌能否将其扩展至更多手语,并持续优化训练以在真实场景中保持翻译质量,值得关注。