Google DeepMind SL2T: Pixel 11向けの手話からテキストへの翻訳

Google DeepMindは、聴覚障害者や難聴者がモバイルデバイス上で手話を主要な入力方法として使用できるようにする、手話からテキストへの翻訳(SL2T)モデルを導入しました。SL2Tは、Pixel 11のGboardおよびLive Transcribeにおける新しい手話からテキストへの音声入力機能を支えており、アメリカ手話(ASL)から英語への対応から始まり、ユーザーがスマートフォンに向かって手話を行うことで、ウェブ検索、メッセージの作成、またはGeminiとの対話が可能になります。

技術アーキテクチャとプライバシー

SL2Tは、ユーザーのプライバシーと処理効率を確保するために、座標ベースの翻訳システムを利用しています。生のカメラ映像を処理する代わりに、システムはMediaPipe Holisticと呼ばれるオンデバイスモデルを使用して、手話者の体のポーズランドマークの位置を追跡します。これらの幾何学的な座標のみが翻訳のためにサーバーに送信され、元のビデオは直ちに破棄されます。

翻訳の品質を向上させるために、SL2Tは、従来のAIによる手話翻訳でよく使用されていた中間的な注釈である「glosses」をバイパスします。座標シーケンスを直接テキストに翻訳することで、モデルは空間的な構成や非手動マーカー(non-manual markers)などの手話の非線形な側面をより適切に捉えることができ、人工的な語彙の制限を取り除くことができます。

学習とパフォーマンス

SL2Tは、50以上の手話にわたる100,000時間以上のデータで学習された大規模な多言語モデルです。そのデータの約25%はASLです。チームは、多様な言語、方言、および習熟度レベルにわたる共同学習を行うことで、モデルが共通の基礎となる構造を学習できることを発見しました。その結果、単一言語モデルよりも優れたパフォーマンスを実現しました。

ベンチマークに関しては、SL2TはASLから英語への翻訳において、FLEURS-ASL (sd-test) ベンチマークで70 BLEURTというゼロショットスコアを達成しました。Google DeepMindは、これを以前に報告されたどのスコアよりも大幅に高いものとして報告しています。

実社会での応用と使いやすさ

学術的なベンチマークを超えて、SL2Tの開発はいくつかの実用的な使いやすさの課題に焦点を当てていました。

  • Streaming Latency: 手話とテキスト出力の間の遅延を最小限に抑えること。
  • Input Filtering: ユーザーが手話をしていないときにハルシネーション(幻覚)が発生するのを防ぐこと。
  • Inclusivity: 左利きの手話者(人口の約10%)に対する公平性を確保し、スマートフォンを保持する際によく見られる片手での手話のパフォーマンスを最適化すること。

コミュニティとの協力とガバナンス

Google DeepMindは、聴覚障害者コミュニティが参加するガバナンスモデルを通じてSL2Tを開発しました。これには、聴覚障害を持つGoogle社員であるSam Sepahによる概念化が含まれ、世界的な聴覚障害者団体および専門家で構成されるAI Sign Language Advisory Committee (AISLAC) の設立が含まれます。

このコラボレーションにより、SL2T 1.0のリリースに向けた共同インパクトレポートが作成され、技術の現在の能力と限界を透明性を持って概説しています。

現在の限界

FLEURS-ASLベンチマークの例に基づくと、モデルは特定の領域で依然として時折エラーが発生します。

  • Rapid fingerspelling: 例えば、「prey」を「grey」と翻訳してしまうこと。

  • Classifier depictions: 「claws」などの特定の詳細を落としてしまうこと。

  • Tense and Passive Constructions: 十分な文脈がない場合の時制や、受動態の文構造における時折のエラー。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch