Gemini 3.5 Live Translate 发布说明

Gemini 3.5 Live Translate 发布说明

Google DeepMind 推出了 Gemini 3.5 Live Translate,这是一款全新的音频模型,旨在为 70 多种语言提供近乎实时的语音对语音翻译。该模型从传统的逐句翻译系统转向连续生成方法,减少了尴尬的停顿,并保持了流畅的对话流,仅比说话者滞后几秒钟。

连续语音对语音翻译

Gemini 3.5 Live Translate 通过在“等待足够上下文以确保质量”与“立即翻译以保持与说话者同步”之间取得平衡,实现了流畅、自然的翻译语音。关键技术能力包括:

  • 韵律保留: 该模型在翻译过程中保留原始说话者的语调、节奏和音高。
  • 自动语言检测: 它能自动检测 70 多种语言,无需手动配置。
  • 噪声鲁棒性: 该模型经过工程设计,可以在嘈杂且不可预测的环境中运行,使其适用于现实世界的应用。

集成与可用性

Gemini 3.5 Live Translate 正在针对不同的用户群体部署到多个平台:

  • 开发者: 通过 Gemini Live API 和 Google AI Studio 提供公开预览。
  • 企业: 本月开始在 Google Meet 中为部分商业 Google Workspace 客户提供私有预览。
  • 普通用户: 通过 Android 和 iOS 上的 Google Translate 应用在全球范围内推出。

Google Meet 增强功能

将 Gemini 3.5 Live Translate 集成到 Google Meet 中,显著扩展了该平台的翻译能力。此次更新将支持的语言数量从五种增加到 70 多种,并将翻译组合从仅限英语对扩展到单次会议中超过 2,000 种语言组合。

移动体验与聆听模式

在 Google Translate 移动应用上,用户可以使用耳机获得镜像说话者语气的无缝体验。Android 用户将特别获得一种全新的“聆听模式”,该模式允许翻译音频直接通过手机听筒流式传输,从而无需耳机即可实现对实时语音(如导览)的私密翻译。

开发者生态系统与现实世界用例

开发者可以使用 Gemini Live API 构建语音翻译应用,并得到包括 Agora、Fishjam、LiveKit、Pipecat 和 Vision Agents 在内的基础设施合作伙伴的支持。

Grab 已经在进行现实世界的测试,该测试正在测试该模型,以促进司机与旅客在接送过程中的近实时沟通,这影响着每月处理超过 1,000 万次语音通话的服务。

安全性与水印

为了防止虚假信息,Gemini 3.5 Live Translate 生成的所有音频都使用 SynthID 进行了水印处理。这种不可察觉的水印直接织入音频输出中,以确保 AI 生成的内容保持可检测性。

Sources