Gemini 2.5 Flash Native Audio リリース:強化されたライブ音声エージェントとリアルタイム音声翻訳

TL;DR

Google DeepMindは、Gemini 2.5 Flash Native Audioをリリースしました。これは、ファンクションコーリング、指示への準拠、マルチターン会話の品質を向上させ、70以上の言語に対応したリアルタイムの音声対音声翻訳機能を追加した、アップグレードされたライブ音声モデルです。


Gemini 2.5 Flash Native Audio の概要

Gemini 2.5 Flash Native Audioは、DeepMindのオーディオ中心のGeminiモデルの最新の反復です。ライブ音声エージェント向けに設計されており、現在は Google AI Studio、Vertex AI、Gemini Live、および Search Live を通じて一般提供されています。このリリースにより、モデルの能力は表現力豊かなテキスト読み上げを超え、堅牢な会話処理とライブ音声翻訳へと拡大します。


技術的な改善点

より正確なファンクションコーリング

  • モデルは、外部関数を呼び出すべきタイミングをより高い信頼性で識別できるようになりました。
  • ComplexFuncBench Audio 評価において、Gemini 2.5 Flash Native Audio は 71.5% のスコアを達成し、ベンチマークをリードしました。

堅牢な指示への準拠

  • 開発者が提供する指示への準拠率は、前のバージョンの 84% から 90% に上昇しました。
  • これにより、複雑なプロンプトに対して、より完全で予測可能な音声出力が可能になります。

よりスムーズなマルチターン会話

  • 対話のターンを越えたコンテキスト取得の強化により、よりまとまりのある自然なインタラクションが実現します。
  • モデルがリアルタイムの情報を回答に統合する際、ユーザーが感じるフローの断絶が減少します。

ライブ音声エージェントのユースケース

このモデルは、Gemini Live でのブレインストーミング セッションから Search Live でのリアルタイムのアシスタンスまで、幅広い会話体験を支えています。企業は、このモデルをカスタマーサービスのパイプラインに組み込むことができ、自然な話し方をし、騒がしい環境に対応し、即座に言語を切り替えられるエージェントを実現できます。

顧客からの声

「ユーザーは Sidekick を使い始めて1分もしないうちに、相手が AI であることを忘れてしまうことがよくあります…Gemini 2.5 Flash Native Audio を通じて提供される新しい Live API AI 機能は、私たちのマーチャントが勝利することを可能にします。」 – David Wurtz, VP of Product, Shopify

「Gemini 2.5 Flash Native Audio モデルを統合することで…Mia の機能を大幅に強化しました…ブローカーパートナーのために 14,000 件以上のローンを生成しました。」 – Jason Bressler, CTO, United Wholesale Mortgage

「Vertex AI を通じて Gemini 2.5 Flash Native Audio モデルを使用することで、Newo.ai AI Receptionists は比類なき会話インテリジェンスを実現できます…騒がしい環境でもメインの話し手を特定し、会話の途中で言語を切り替え、驚くほど自然で感情豊かな表現が可能です。」 – David Yang, Co-founder, Newo.ai


ライブ音声翻訳

Gemini は現在、以下の2つのモードで動作する、ネイティブなリアルタイム音声対音声翻訳を提供しています:

  • 継続的リスニング (Continuous Listening) – あらゆる言語の周囲の音声を単一のターゲット言語に翻訳し、ユーザーがヘッドフォンを装着して好みの言語で世界の声を聞くことを可能にします。
  • 双方向会話 (Two-Way Conversation) – 話し手に基づいて出力言語を動的に切り替え、シームレスなバイリンガル対話(例:英語 ↔ ヒンディー語)を可能にします。

コア翻訳機能

機能 説明
言語カバー範囲 Gemini の多言語知識を活用し、70以上の言語と 2,000 の言語ペアをサポート。
スタイル転送 イントネーション、ペース、ピッチを維持し、翻訳された音声が自然に聞こえるようにします。
多言語入力 単一のセッション内で複数のソース言語を処理します。
自動検出 話されている言語を自動的に検出し、手動での選択を必要としません。
ノイズ耐性 騒がしい環境でもクリアな翻訳ができるよう、周囲のノイズをフィルタリングします。

ベータ版体験は Google 翻訳アプリで利用可能です(Android は米国、メキシコ、インドで展開中;iOS およびその他の地域は近日公開予定)。フィードバックは、2026年に予定されている Gemini API リリースを含む、さらなる統合の指針となります。


はじめに

開発者は、以下の方法で Gemini 2.5 Flash Native Audio を使用した音声エージェントの構築を開始できます:

  • Vertex AI – 本番環境のワークロード向けに一般提供。
  • Gemini API preview – Gemini API ドキュメントからアクセス可能。
  • Google AI Studio – 迅速なプロトタイピングのためのインタラクティブなプレイグラウンド。

Gemini 2.5 Flash および Gemini 2.5 Pro のテキスト読み上げモデルも Gemini API を通じて利用可能であり、包括的なドキュメント、プロンプトガイド、およびサンプルノートブックのクックブックが用意されています。


影響

このリリースは、静的なテキスト読み上げから、完全にインタラクティブなオーディオ・ファーストの AI 体験への転換を意味します。信頼性の高いファンクションコーリング、高い指示忠実度、およびリアルタイムの多言語翻訳を組み合わせることで、Gemini 2.5 Flash Native Audio は、より自然なエンタープライズグレードの音声エージェントを可能にし、特に視覚的なインターフェースが不適切なシナリオにおいて、グローバルなコミュニケーションの新しい道を切り開きます。


参考文献

Sources