Gemini 3.8 Live および 3.8 Live Extended Thinking のリリース

Google は、ニアリアルタイムの推論と直感的な音声対話に最適化された2つの新しいモデル「Gemini 3.8 Live」および「Gemini 3.8 Live Extended Thinking」をリリースしました。これらのモデルは、より流暢で協力的な対話と、音声を通じた複雑なタスクの実行を可能にするよう設計されており、開発者とエンタープライズユーザーの両方をターゲットにしています。

高性能な音声推論とベンチマーク

Gemini 3.8 Live Extended Thinking は、複雑なワークフローのための高知能モデルとして位置付けられています。現在、Artificial Analysis の Speech to Speech Quality Index でスコア 82.6 を記録し、トップに立っています。エージェントによるタスク完了率では、$ au$-Voice で 68.6%、Sierra の $ au$-Voice-banking ベンチマークで 35.1% を達成しています。さらに、Big Bench Audio では 97.7% のスコアを記録しました。

Gemini 3.8 Live は、スケーラビリティとコスト効率を重視して設計されており、Speech Agent Arena で2位を獲得しました。両モデルとも、正確さと会話の質のバランスを保つ能力に優れており、ServiceNow の EVA-Bench において複雑なワークフローのパレート最適解を押し上げています。

主要な技術的機能

リアルタイムのマルチモーダル統合

Gemini 3.8 Live は視覚入力をニアリアルタイムで処理し、会話を視覚的なコンテキストに基づかせることを可能にします。また、会話の途中でサポートされている97言語を自動的に検出し、切り替えることができます。

並列実行と推論

Gemini 3.8 Live は、継続的な会話を維持しながら、バックグラウンドでツールや API 呼び出しを実行できます。Gemini 3.8 Live Extended Thinking はこれをさらに推し進め、推論と発話を同時に行います。自然な口頭の合図(例:「確認しますね...」)や、進行状況のライブナレーションを使用することで、会話の流れを中断することなく、マルチステップのバックグラウンドタスクの状況をユーザーに伝えます。

開発者およびエンタープライズエコシステム

Google は、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents などの開発者プラットフォームと統合された Gemini Live API を通じてこれらのモデルを提供しています。これらのプラットフォームはリアルタイムのメディアストリーミングインフラストラクチャを処理するため、開発者はユーザーエクスペリエンスに集中できます。

Salesforce、Genspark、Lumeris などのエンタープライズパートナーは、すでにこれらのモデルの利用を開始しており、低遅延と強力なツール呼び出し機能を高く評価しています。

安全性と可用性

誤情報の拡散を防ぐため、これらのモデルによって生成されるすべての音声には SynthID を使用した電子透かしが埋め込まれています。これは、音声出力に直接織り込まれた知覚不可能な透かしです。

提供状況:

  • Gemini 3.8 Live: Gemini API および Google AI Studio を通じて開発者が利用可能。Gemini Enterprise ではプライベートプレビュー中。Search Live ではすべてのユーザーが利用可能。
  • Gemini 3.8 Live Extended Thinking: Gemini API および Google AI Studio を通じて開発者が利用可能。Gemini Enterprise および Google Workspace ビジネス顧客向けにプライベートプレビュー中。Workspace (Docs) の Google AI Pro および Ultra 加入者、ならびに Gmail および Keep のすべての Google AI 加入者が利用可能。

コミュニティのフィードバックとユーザーの洞察

このリリースに対するユーザーの反応はまちまちで、実際のアプリケーションにおけるモデルの強みと弱みの両方が浮き彫りになっています。

強み

  • 言語サポート: ユーザーは、マイナーな言語を扱うモデルの能力を称賛しており、あるユーザーは「[Afrikaans] を話す能力は驚異的」であり、希少言語の貴重な会話パートナーになると述べています。
  • ユーザーエクスペリエンス: 一部のユーザーは、低遅延であることや、強い訛りにもうまく対応できる心地よくリアルな音声を報告しています。

弱みと懸念

  • ハルシネーションと信頼性: 一部の開発者は、エージェント的なシナリオにおいてモデルが「より愚か」になることがあり、存在しない要件や実装の詳細をでっち上げると報告しています。
  • 推論の深さ: 「Extended Thinking(拡張された思考)」というブランディングには懐疑的な見方があり、あるユーザーは、誤った回答が多すぎる場合があるため「わずかに拡張された思考」に改名すべきだと提案しています。
  • 技術的な問題: モデルが自分自身に返信し続ける無限ループに陥ったり、ランダムに言語を切り替えたりするという報告が上がっています。
  • 製品統合: ユーザーは、バージョンの展開が不整合であること(例:一部のユーザーが依然として 3.6 Flash を見ている)や、電話通話統合のための SIP (Session Initiation Protocol) がサポートされていないことに対して不満を表明しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch