谷歌最強手語翻譯模型來了!能搜索發消息,已接入手機

2026年8月13日 08:31
站內 AI 整理稿

編譯 | 楊京麗 編輯 | 李水青 8月13日消息,昨日,谷歌DeepMind推出大規模多語言手語轉文本(sign-language-to-text,SL2T)翻譯模型。SL2T已率先接入Pixel 11上的谷歌輸入法Gboard和實時轉寫應用Live Transcribe,首批支持將美國手語翻譯成英文。用戶可以直接對手機打手語,用於搜索網頁、撰寫消息或文檔,以及向Gemini提問和交代任務。▲谷歌DeepMind發佈手語翻譯模型SL2T(圖源:X) 該模型的訓練過程使用超過10萬小時數據,覆蓋50多種手語。

谷歌稱,SL2T在美國手語到英文翻譯測試中的零樣本BLEURT得分達到70,是目前最強的美國手語翻譯模型。這是谷歌首次將手語AI從實驗室引入消費產品。SL2T會先將用戶的身體動作轉換為關鍵點座標,再直接生成文字,在保護原始視頻隱私的同時,避免傳統手語標註方式帶來的信息和詞彙限制。一、用戶可用手語搜索、寫消息和向Gemini提問 全球共有超過200種手語,約7000萬聾人及聽障人士使用這些語言。藉助SL2T,用戶可以像使用語音輸入一樣,直接對手機打手語,輸入文字。例如,用戶可以用手語搜索網頁、撰寫消息或文檔,也可以向Gemini提問或要求其執行任務。

在Live Transcribe中,用戶可以直接用手語回覆對話,無需雙方反覆打字。谷歌稱,測試用戶認為使用美國手語輸入比輸入英文更快、更自然。與語音轉寫相比,手語翻譯面臨兩項核心挑戰。首先,語音轉寫是在同一種語言中,將聲音按照順序映射為文字;手語則是擁有獨立語法和詞彙的自然語言。因此,手語需要真正的機器翻譯,而不是按照順序將手勢逐一轉換成單詞。其次,模型需要學會“看見”並理解身體動作。手語通過手、手臂、軀幹、頭部和麵部同時發生的動作傳遞含義。在高幀率下,準確追蹤這些動作,是一項難度和計算量都很高的計算機視覺任務。

▲模型根據肢體動作和表情翻譯手語(圖源:谷歌DeepMind) 手語手套等早期手語技術存在根本性侷限,因為手語並非簡單的“用手錶達英語”。它既需要對細微的全身動作進行復雜的視覺感知,也需要完整的語言翻譯能力。SL2T旨在同時解決這兩項問題。二、超10萬小時數據訓練,覆蓋50多種手語 SL2T使用超過10萬小時數據訓練,覆蓋50多種手語,其中約四分之一為美國手語數據。谷歌稱,將不同手語、方言及不同熟練程度的使用者放在一起訓練,有助於模型學習共享的底層結構,實驗效果優於單語模型。為了保護隱私,SL2T不會將原始攝像頭畫面直接發送到服務器。

手機端的MediaPipe Holistic模型會先追蹤用戶身體上的關鍵點,僅將相應的幾何座標發送至服務器進行翻譯,原始視頻可以立即丟棄。SL2T會把這些座標序列直接轉換成文字,不需要經過手語翻譯研究中常用的中間標註。谷歌認為,直接翻譯可以更好地處理面部動作和空間結構等信息,同時擺脫人工標註的詞彙範圍限制。谷歌稱,在評估美國手語到英文翻譯質量的FLEURS-ASL測試中,SL2T是迄今為止最強大的手語翻譯模型,其零樣本BLEURT得分達到70,明顯高於此前公開結果。谷歌還針對流式翻譯延遲、非手語輸入引發的幻覺、左撇子及單手打手語等真實場景進行了優化。

谷歌列出了下面5組案例,左側為英文原文,右側為SL2T根據手語翻譯出的英文。▲SL2T翻譯案例(圖源:谷歌DeepMind) 可以看出SL2T能夠較為準確地傳達原文意思。不過,模型仍可能在罕見手勢、快速手指拼寫、被動語態、空間描述和缺乏上下文的時態判斷中出錯。谷歌稱,聾人社區參與了SL2T從構想、數據收集到用戶測試和影響評估的整個過程。公司還成立了AI手語顧問委員會(AISLAC),邀請全球聾人組織和相關專家參與制定產品開發重點,並共同發佈SL2T 1.0影響報告。

結語:手語翻譯模型走進消費產品 SL2T的進展不僅體現在訓練數據規模和基準測試成績上,更重要的是,它已經進入輸入法和實時轉寫等實際使用場景,讓手語像語音一樣成為手機輸入方式。不過,SL2T首批僅支持美國手語到英文的翻譯,在罕見手勢、快速手指拼寫、空間描述和時態判斷等方面仍會出錯。後續,期待谷歌能夠將其擴展至更多手語,持續優化訓練,在真實場景中保持翻譯質量。來源:谷歌DeepMind

Related

相關文章

量子位生成式AI

阿里視頻大模型Wan3.0正式上線,行業評價“穩定、真實、有質感”

阿里巴巴影片生成大模型Wan3.0正式上線,單次可生成30秒影片,並首次支援doc、xls、ppt、pdf、md等文檔輸入。企業用戶普遍評價其「穩定、真實、有質感」,能穩定保持角色與場景一致性,並已進入短劇、影視、廣告等生產流程。即日起可於阿里雲百鍊、千問等平台體驗,標準版並推出限時7折優惠。

剛剛
IT之家生成式AI

阿里雲視頻生成模型 Wan3.0 正式上線,支持單次生成 30 秒視頻、文檔輸入

作者:遠洋 責編:遠洋 評論: 8 月 24 日消息,阿里雲消息,今天,視頻生成模型 Wan3.0 正式上線。官方稱,Wan3.0 在生成時長、萬能創作、全能參考以及真實世界還原等維度全面升級,單次可生成 30 秒視頻,並首次支持 doc、xls、ppt、pdf、md 等文檔格式輸入,力求準確還原真實世界。

剛剛