谷歌DeepMind於8月12日推出大規模多語言手語轉文本(SL2T)翻譯模型,並率先將其接入Pixel 11手機上的谷歌輸入法Gboard和即時轉寫應用Live Transcribe,首批支援將美國手語翻譯成英文。這是谷歌首次將手語AI從實驗室引入消費產品,使用者可以直接對手機打手語,用於搜尋網頁、撰寫訊息或文件,以及向Gemini提問和交代任務。
據谷歌介紹,SL2T的訓練過程使用了超過10萬小時的資料,覆蓋50多種手語,其中約四分之一為美國手語資料。谷歌表示,將不同手語、方言及不同熟練程度的使用者放在一起訓練,有助於模型學習共享的底層結構,實驗效果優於單語模型。在美國手語到英文翻譯的FLEURS-ASL測試中,SL2T的零樣本BLEURT得分達到70,谷歌稱其為迄今為止最強大的手語翻譯模型,明顯高於此前公開結果。
與語音轉寫相比,手語翻譯面臨兩項核心挑戰。首先,語音轉寫是在同一種語言中,將聲音按順序對映為文字;而手語是擁有獨立語法和詞彙的自然語言,需要真正的機器翻譯,而非按順序將手勢逐一轉換成單詞。其次,模型需要學會“看見”並理解身體動作,手語通過手、手臂、軀幹、頭部和麵部同時發生的動作傳遞含義,在高幀率下準確追蹤這些動作是難度和計算量都很高的計算機視覺任務。
為了保護隱私,SL2T不會將原始攝像頭畫面直接傳送到伺服器。手機端的MediaPipe Holistic模型會先追蹤使用者身體上的關鍵點,僅將相應的幾何座標傳送至伺服器進行翻譯,原始影片可以立即丟棄。SL2T會將這些座標序列直接轉換成文字,不需要經過手語翻譯研究中常用的中間標註。谷歌認為,直接翻譯可以更好地處理面部動作和空間結構等資訊,同時擺脫人工標註的詞彙範圍限制。
全球共有超過200種手語,約7000萬聾人及聽障人士使用這些語言。藉助SL2T,使用者可以像使用語音輸入一樣,直接對手機打手語輸入文字。例如,使用者可以用手語搜尋網頁、撰寫訊息或文件,也可以向Gemini提問或要求其執行任務。在Live Transcribe中,使用者可以直接用手語回覆對話,無需雙方反覆打字。谷歌稱,測試使用者認為使用美國手語輸入比輸入英文更快、更自然。
谷歌還針對流式翻譯延遲、非手語輸入引發的幻覺、左撇子及單手打手語等真實場景進行了最佳化。不過,模型仍可能在罕見手勢、快速手指拼寫、被動語態、空間描述和缺乏上下文的時態判斷中出錯。
谷歌表示,聾人社群參與了SL2T從構想、資料收集到使用者測試和影響評估的整個過程。公司還成立了AI手語顧問委員會(AISLAC),邀請全球聾人組織和相關專家參與制定產品開發重點,並共同釋出SL2T 1.0影響報告。
SL2T的進展不僅體現在訓練資料規模和基準測試成績上,更重要的是,它已經進入輸入法和即時轉寫等實際使用場景,讓手語像語音一樣成為手機輸入方式。不過,SL2T首批僅支援美國手語到英文的翻譯,在罕見手勢、快速手指拼寫、空間描述和時態判斷等方面仍會出錯。後續,谷歌能否將其擴充套件至更多手語,並持續最佳化訓練以在真實場景中保持翻譯質量,值得關注。