Gemini 3.5 Live Translate リリースノート
Gemini 3.5 Live Translate リリースノート
Google DeepMindは、70以上の言語でニアリアルタイムの音声対音声翻訳を実現するために設計された新しいオーディオモデル、Gemini 3.5 Live Translateを発表しました。このモデルは、従来のターンバイターン(交互)の翻訳システムから、連続的な生成アプローチへと移行しており、不自然な間を減らし、話し手のわずか数秒後を追う流暢な会話の流れを維持します。
連続的な音声対音声翻訳
Gemini 3.5 Live Translateは、品質を確保するために十分なコンテキストを待つことと、話し手との同期を維持するために即座に翻訳することのトレードオフのバランスを取ることで、流暢で自然な翻訳音声を可能にします。主な技術的能力は以下の通りです:
- 韻律(Prosody)の保持: このモデルは、翻訳中に元の話し手のイントネーション、ペース、ピッチを保持します。
- 自動言語検出: 手動での設定を必要とせず、70以上の言語を自動的に検出します。
- ノイズへの堅牢性: このモデルは、騒がしく予測不可能な環境でも機能するように設計されており、実世界のアプリケーションに適しています。
統合と利用可能性
Gemini 3.5 Live Translateは、さまざまなユーザー層に向けて複数のプラットフォームで展開されています:
- 開発者: Gemini Live APIおよびGoogle AI Studioを通じてパブリックプレビューとして利用可能です。
- 企業: 今月中に、一部のビジネス向けGoogle Workspaceのお客様向けにGoogle Meetでのプライベートプレビューを開始します。
- 一般ユーザー: AndroidおよびiOSのGoogle Translateアプリを通じて、世界中で展開されています。
Google Meet の機能強化
Gemini 3.5 Live TranslateのGoogle Meetへの統合は、プラットフォームの翻訳機能を大幅に拡大します。このアップデートにより、サポートされる言語数は5つから70以上に増加し、翻訳の組み合わせは英語のみのペアから、単一の会議内で2,000以上の言語の組み合わせへと拡大します。
モバイル体験とリスニングモード
Google Translateのモバイルアプリでは、ユーザーはヘッドフォンを使用して、話し手のトーンを反映したシームレスな体験を利用できます。特にAndroidユーザーには新しい「リスニングモード」が提供され、翻訳されたオーディオを電話のイヤースピーカーから直接ストリーミングできるため、ヘッドフォンを必要とせずにライブ音声(ガイド付きツアーなど)のプライベートな翻訳が可能になります。
開発者エコシステムと実世界のユースケース
開発者は、Agora、Fishjam、LiveKit、Pipecat、Vision Agentsを含むインフラパートナーのサポートを受け、Gemini Live APIを使用して音声翻訳アプリを構築できます。
実世界でのテストはすでにGrabによって進められており、Grabはピックアップ中のドライバーと旅行者の間のニアリアルタイムのコミュニケーションを促進するためにこのモデルをテストしています。これは、月に1,000万件以上の音声通話を処理するサービスに影響を与えます。
安全性とウォーターマーキング
誤情報の拡散を防ぐため、Gemini 3.5 Live Translateによって生成されたすべてのオーディオには、SynthIDを使用してウォーターマーク(電子透かし)が埋め込まれています。この知覚不可能なウォーターマークは、AI生成コンテンツが検出可能な状態を維持できるように、オーディオ出力に直接織り込まれています。