Google DeepMind SL2T: Pixel 11 的手語轉文字翻譯技術
Google DeepMind 推出了手語轉文字 (SL2T) 技術,這是一種翻譯模型,讓聽障與聽力受損的使用者能在行動裝置上將手語作為主要的輸入方式。SL2T 為 Pixel 11 上的 Gboard 與 Live Transcribe 提供全新的手語轉文字語音輸入功能,讓使用者能透過手語對手機進行網頁搜尋、撰寫訊息或與 Gemini 互動,首波支援從美國手語 (ASL) 翻譯至英文。
技術架構與隱私保護
SL2T 使用基於座標的翻譯系統,以確保使用者隱私與處理效率。該系統並非處理原始攝影機影像,而是採用名為 MediaPipe Holistic 的裝置端模型來追蹤簽署者的身體姿勢關鍵點位置。系統僅將這些幾何座標傳送到伺服器進行翻譯,原始影片會立即被捨棄。
為了提升翻譯品質,SL2T 跳過了「手語詞彙 (glosses)」——這是以往手語 AI 常用的中間註解。透過直接將座標序列翻譯成文字,模型能更有效地捕捉手語的非線性特徵,例如空間結構與非手部動作標記,從而消除人為的詞彙限制。
訓練與效能表現
SL2T 是一個大規模多語言模型,在超過 50 種手語的 100,000 小時以上數據上進行了訓練,其中約 25% 的數據為 ASL。團隊發現,透過在多種語言、方言與熟練程度不同的數據上進行聯合訓練,能讓模型學習到共同的底層結構,進而獲得比單一語言模型更佳的效能表現。
在基準測試方面,SL2T 在 FLEURS-ASL (sd-test) 基準測試中,針對 ASL 轉英文的翻譯取得了 70 BLEURT 的零樣本 (zero-shot) 分數,Google DeepMind 報告指出,這比以往任何已報告的分數都顯著更高。
真實世界應用與可用性
除了學術基準測試之外,SL2T 的開發也著重於解決幾個實際的可用性挑戰:
- 串流延遲: 最小化手語輸入與文字輸出之間的延遲。
- 輸入過濾: 防止使用者未在進行手語輸入時產生幻覺 (hallucinations)。
- 包容性: 確保對左撇子簽署者(約佔人口 10%)的公平性,並針對單手簽署進行優化,這在手持智慧型手機時非常常見。
社群協作與治理模式
Google DeepMind 開發 SL2T 時採用了參與式治理模式,讓聽障社群參與其中。這包括由聽障 Google 員工 Sam Sepah 發起的構思,以及成立了 AI Sign Language Advisory Committee (AISLAC),該委員會由全球聽障組織與領域專家組成。
這次協作促成了 SL2T 1.0 發布時的聯合影響力報告,透明地概述了該技術目前的技術能力與限制。
目前的限制
根據 FLEURS-ASL 基準測試範例,模型在特定領域仍偶爾會出現錯誤:
- 快速手指拼寫 (fingerspelling): 例如,將「prey」誤譯為「grey」。
- 分類器描繪 (Classifier depictions): 遺漏特定細節,例如「claws」。
- 時態與被動語態結構: 在缺乏足夠上下文或在被動句結構中,偶爾會出現時態錯誤。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch