Grok Voice Think Fast 2.0 發佈說明

xAI 已宣布推出 Grok Voice Think Fast 2.0,這是一款旨在提升語音推理、轉錄準確度以及對話流暢度的次世代語音模型。該模型旨在於智慧程度與實際應用表現上,皆超越先前的版本及競爭對手的語音對語音模型。

智慧程度與基準測試

Grok Voice Think Fast 2.0 在語音推理與代理效能方面展現了顯著的提升。根據 Artificial Analysis 的數據,該模型的 Overall AA Speech-to-Speech Quality Index 達到 82.9%,超越了 GPT-Realtime-2.1 (High) 的 79.1% 以及 Gemini 3.1 Flash (High) 的 69.5%。

關鍵效能指標包括:

  • Speech Reasoning (Big Bench Audio): 97.2%
  • Conversational Dynamics (Full Duplex Bench): 95.1%
  • Agentic Performance (τ-voice Bench): 56.5%,在所有比較模型中最高,包括 GPT-Realtime-2.1 (45.7%) 與 Gemini 3.1 Flash (37.7%)
  • Latency: Time to First Audio 為 0.70s,明顯快於 Grok Voice Think Fast 1.0 (1.25s) 與 Gemini 3.1 Flash (2.98s)

真實世界場景中的轉錄準確度

Grok Voice Think Fast 2.0 提供的轉錄準確度超越了專用的尖端轉錄模型。在針對 24 種語言與數千個短句的評估中,該模型相較於 Deepgram Nova 3 與 ElevenLabs Scribe v2 提升了 1.5–2.0×,且相較於其前代版本提升了 1.4×。

效能提升在挑戰性環境中尤為明顯。在嘈雜的環境中,特別是涉及背景噪音與電話壓縮的場景,Grok Voice Think Fast 2.0 與專用語音轉文字模型之間的準確度差距擴大至約 10×。

平行推理效率

與傳統的語音對語音模型不同,Grok Voice Think Fast 模型在說話的同時進行查詢推理。這種平行推理機制讓模型在不增加延遲的情況下,能展現出更高的智慧程度。

Grok Voice Think Fast 2.0 在推理標記 (reasoning tokens) 的使用上顯著更具效率。與 Grok Voice Think Fast 1.0 相比,每次回應所使用的推理標記 (P50) 僅為 0.4×。在實際生產環境中,這種效率提升帶來了更快的工具調用 (tool calls),這些調用通常在代理人完成其第一句話之前就已執行完畢。

對話能力與 RL 訓練

為了提升對話的流暢度,xAI 使用了廣泛的強化學習 (reinforcement learning) 來使模型與真實的人類對話模式對齊。這種訓練方式讓模型能以較短的句子說話、一次僅提出一個問題,並避免不必要的贅語。這使得模型能夠在引導使用者進行複雜的工作流程時,仍能維持簡單且流暢的使用者體驗。

遷移、定價與部署

於 2026 年 8 月 5 日,grok-voice-latest 別名將自動從 1.0 版本遷移至 2.0 版本。希望保留在 1.0 版本的用戶,必須在該日期之前將其實作固定在 grok-voice-think-fast-1.0

Pricing: Grok Voice Think Fast 2.0 的定價為每分鐘音訊 $0.08。

Real-world Impact: 在 Starlink 服務上的 A/B 測試顯示,部署此模型後,銷售轉換率與客服問題解決率 (support containment rates) 均有顯著提升。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch