Gemini 3.1 Flash Live リリースノート / 新機能

Gemini 3.1 Flash Live リリースノート / 新機能 Google DeepMind は、精度の向上、レイテンシの低減、そしてグローバル展開の拡大を実現した、自然なリアルタイム対話向けの高品質オーディオ・音声モデルである Gemini 3.1 Flash Live をリリースしました。

Gemini 3.1 Flash Live リリースノート / 新機能

Google DeepMind は、これまでで最高品質のオーディオおよび音声モデルである Gemini 3.1 Flash Live のリリースを発表しました。このモデルは、レイテンシを削減し、音響的ニュアンスの理解能力を向上させることで、より流暢で自然かつ正確なリアルタイム対話を可能にするよう設計されています。

技術的パフォーマンスとベンチマーク

Gemini 3.1 Flash Live は、音声優先エージェントにおける推論とタスク実行において大幅な改善を示しています。モデルは複数の主要なオーディオベンチマークでトップに立っています。

  • ComplexFuncBench Audio: モデルは 90.8% のスコアを達成し、さまざまな制約下でのマルチステップ関数呼び出しでトップになりました。
  • Audio MultiChallenge (Scale AI): 「thinking」機能を有効にした状態で、モデルは 36.1% のスコアを取得し、実際の音声中断やためらいがある中での複雑な指示の遵守と長期的推論のテストでトップになりました。

強化されたオーディオ機能

このモデルは、音調の理解と音響感度が向上しており、より自然なやり取りが可能です。

  • Tonal Recognition: Gemini 3.1 Flash Live は、従来の 2.5 Flash Native Audio モデルに比べて、ピッチと速度の認識がより効果的です。
  • Dynamic Response: ユーザーがフラストレーションや混乱を表現した際に、モデルは応答を動的に調整できます。
  • Environmental Robustness: 騒がしい環境下でも複雑なタスクを処理できるよう設計されています。

製品統合と利用可能性

Gemini 3.1 Flash Live は、さまざまなユーザー層向けに複数の Google プラットフォームに統合されています。

  • Developers: Google AI Studio の Gemini Live API を通じてプレビュー版として利用可能です。
  • Enterprises: カスタマーエクスペリエンス向けの Gemini Enterprise を通じて利用可能です。
  • General Users: Search Live と Gemini Live に統合されています。

ユーザー体験の改善

エンドユーザーにとって、3.1 Flash Live モデルは、より直感的なインタラクション体験を提供します。

  • Faster Responses: Gemini Live は、従来のバージョンに比べて応答が速くなりました。
  • Extended Context: 会話の流れを従来の2倍の長さで追跡でき、長時間のブレインストーミングセッションの連続性が向上します。
  • Global Expansion: モデルが持つ多言語対応能力により、Search Live は200か国以上・地域に拡大し、好みの言語でリアルタイムのマルチモーダル会話が可能になりました。

安全性と責任

誤情報の拡散を防止するため、Gemini 3.1 Flash Live が生成するすべての音声には SynthID を使用して透かしが付与されています。この知覚できない透かしは音声出力に直接組み込まれ、AI生成コンテンツの確実な検出を可能にします。

Sources