Google DeepMind SL2T: Pixel 11 的手语转文本翻译技术
Google DeepMind 推出了手语转文本 (SL2T) 技术,这是一种翻译模型,使听障及听力受损用户能够在移动设备上将手语作为主要的输入方式。SL2T 为 Pixel 11 上的 Gboard 和 Live Transcribe 提供了全新的手语转文本听写功能,允许用户通过对手语进行操作来搜索网页、起草消息或与 Gemini 进行交互,首发支持美国手语 (ASL) 转英语。
技术架构与隐私
SL2T 使用基于坐标的翻译系统,以确保用户隐私和处理效率。该系统并非处理原始摄像头画面,而是采用名为 MediaPipe Holistic 的设备端模型来追踪签名者身体的姿态关键点位置。只有这些几何坐标会被发送到服务器进行翻译,原始视频会立即被丢弃。
为了提高翻译质量,SL2T 绕过了“手语词汇 (glosses)”——即以往手语 AI 中常用的中间注释。通过将坐标序列直接翻译成文本,该模型能更好地捕捉手语的非线性特征,例如空间结构和非手部动作标记,从而消除了人为的词汇限制。
训练与性能
SL2T 是一个大规模多语言模型,在超过 50 种手语的 100,000 小时以上的数据上进行了训练,其中约 25% 的数据为 ASL。团队发现,在多种语言、方言和熟练程度水平上的联合训练,使模型能够学习共享的底层结构,从而获得比单一语言模型更好的性能。
在基准测试方面,SL2T 在 FLEURS-ASL (sd-test) 基准测试中,针对 ASL 转英语翻译实现了 70 BLEURT 的零样本得分,Google DeepMind 报告称,这一得分显著高于以往任何已报道的得分。
实际应用与可用性
除了学术基准测试,SL2T 的开发还专注于解决几个实际的可用性挑战:
- Streaming Latency: 最小化手语动作与文本输出之间的延迟。
- Input Filtering: 防止用户在未进行手语动作时产生幻觉。
- Inclusivity: 确保对左撇子签名者(约占人口的 10%)的公平性,并针对单手手语动作进行性能优化,这在手持智能手机时非常常见。
社区协作与治理
Google DeepMind 通过一种涉及听障社区的参与式治理模型开发了 SL2T。这包括由听障人士 Googler Sam Sepah 发起的构思,以及成立了 AI Sign Language Advisory Committee (AISLAC),该委员会由全球听障组织和领域专家组成。
这种协作促共生出了 SL2T 1.0 发布时的联合影响报告,透明地概述了该技术的当前能力与局限性。
当前局限性
根据 FLEURS-ASL 基准测试示例,该模型在特定领域仍会出现偶发性错误:
- Rapid fingerspelling: 例如,将 "prey" 翻译为 "grey"。
- Classifier depictions: 丢失特定细节,例如 "claws"。
- Tense and Passive Constructions: 在缺乏足够上下文或在被动句结构中,时态可能会出现偶发性错误。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch