Grok Voice Think Fast 2.0 リリースノート
xAIは、音声推論、文字起こしの精度、および会話の流暢さを向上させるために設計された次世代音声モデル、Grok Voice Think Fast 2.0を発表しました。このモデルは、知能と実世界のパフォーマンスの両面において、以前のバージョンや競合する音声対音声モデルを凌駕するように構築されています。
知能とベンチマーク
Grok Voice Think Fast 2.0は、音声推論とエージェントとしてのパフォーマンスにおいて大幅な向上を示しています。Artificial Analysisのデータによると、このモデルはOverall AA Speech-to-Speech Quality Indexで82.9%を達成し、GPT-Realtime-2.1 (High)の79.1%やGemini 3.1 Flash (High)の69.5%を上回っています。
主なパフォーマンス指標は以下の通りです:
- Speech Reasoning (Big Bench Audio): 97.2%
- Conversational Dynamics (Full Duplex Bench): 95.1%
- Agentic Performance (τ-voice Bench): 56.5%(GPT-Realtime-2.1 (45.7%)やGemini 3.1 Flash (37.7%)を含む比較対象モデルの中で最高)
- Latency: Time to First Audioは0.70sであり、Grok Voice Think Fast 1.0 (1.25s)やGemini 3.1 Flash (2.98s)よりも大幅に高速です。
実環境における文字起こし精度
Grok Voice Think Fast 2.0は、専用の最先端文字起こしモデルを凌駕する文字起こし精度を提供します。24言語と数千の短いフレーズにわたる評価において、このモデルはDeepgram Nova 3およびElevenLabs Scribe v2に対して1.5–2.0倍、前身モデルに対して1.4倍の改善を示しました。
パフォーマンスの向上は、困難な環境で最も顕著になります。Grok Voice Think Fast 2.0と専用の音声文字起こしモデルとの精度の差は、ノイズの多い環境(特に背景ノイズや電話回線の圧縮を伴うもの)において、約10倍に拡大します。
並列推論の効率性
従来の音声対音声モデルとは異なり、Grok Voice Think Fastモデルは話しながらクエリを推論します。この並列推論により、モデルはレイテンシを増やすことなく、より高い知能を実現できます。
Grok Voice Think Fast 2.0は、推論トークンの使用において大幅に効率化されています。Grok Voice Think Fast 1.0と比較して、レスポンスあたりの推論トークン使用量(P50)は0.4倍になっています。本番環境では、この効率性によりツール呼び出しが高速化され、通常、エージェントが最初の文を話し終える前に実行されます。
会話能力とRLトレーニング
会話の流暢さを向上させるために、xAIは広範な強化学習(RL)を使用して、モデルを実際の人間のような会話パターンに合わせました。このトレーニングにより、モデルはより短い文章で話し、一度に一つの質問のみを行い、不要な無駄を避けるようになります。これにより、モデルはシンプルで流暢なユーザー体験を維持しながら、複雑なワークフローをユーザーに案内することが可能になります。
移行、価格設定、およびデプロイメント
2026年8月5日に、grok-voice-latest エイリアスはバージョン1.0から2.0へ自動的に移行します。バージョン1.0を使い続けたいユーザーは、その日付までに実装を grok-voice-think-fast-1.0 に固定する必要があります。
Pricing: Grok Voice Think Fast 2.0の価格は、音声1分あたり$0.08です。
Real-world Impact: StarlinkサービスでのA/Bテストの結果、このモデルの導入により、販売コンバージョン率とサポートの封じ込め率(containment rates)が大幅に向上したことが示されました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch