Grok Voice Think Fast 2.0 发布说明
xAI 宣布推出 Grok Voice Think Fast 2.0,这是一款旨在提高语音推理、转录准确性和对话流畅度的下一代语音模型。该模型旨在在智能和实际性能方面超越之前的迭代版本以及竞争对手的语音到语音模型。
智能与基准测试
Grok Voice Think Fast 2.0 在语音推理和智能体性能方面表现出显著提升。根据 Artificial Analysis 的数据,该模型的 Overall AA Speech-to-Speech Quality Index 达到了 82.9%,超过了 GPT-Realtime-2.1 (High) 的 79.1% 和 Gemini 3.1 Flash (High) 的 69.5%。
关键性能指标包括:
- Speech Reasoning (Big Bench Audio): 97.2%
- Conversational Dynamics (Full Duplex Bench): 95.1%
- Agentic Performance (τ-voice Bench): 56.5%,在包括 GPT-Realtime-2.1 (45.7%) 和 Gemini 3.1 Flash (37.7%) 在内的对比模型中处于最高水平
- Latency: 首个音频生成时间 (Time to First Audio) 为 0.70s,显著快于 Grok Voice Think Fast 1.0 (1.25s) 和 Gemini 3.1 Flash (2.98s)
实际场景中的转录准确性
Grok Voice Think Fast 2.0 提供的转录准确性优于专门的先进转录模型。在针对 24 种语言和数千个短语的评估中,该模型比 Deepgram Nova 3 和 ElevenLabs Scribe v2 提高了 1.5–2.0×,比其前代版本提高了 1.4×。
性能提升在挑战性环境中最为显著。在嘈杂的环境中,特别是涉及背景噪音和电话压缩的环境中,Grok Voice Think Fast 2.0 与专用语音转文本模型的准确度差距扩大到约 10×。
并行推理效率
与传统的语音到语音模型不同,Grok Voice Think Fast 模型在说话的同时进行查询推理。这种并行推理允许模型在不增加延迟的情况下变得更加智能。
Grok Voice Think Fast 2.0 在推理 token 的使用上显著提高了效率。与 Grok Voice Think Fast 1.0 相比,它在每次响应中使用的推理 token (P50) 仅为 0.4×。
在生产环境中,这种效率带来了更快的工具调用 (tool calls),这些调用通常在智能体完成其第一句话之前就已经执行完毕。
对话能力与 RL 训练
为了提高对话流畅度,xAI 使用了广泛的强化学习来使模型与真实的人类对话模式对齐。这使得模型能够使用更短的句子、一次只问一个问题,并避免不必要的废话。这使得模型能够引导用户完成复杂的流程,同时保持简单流畅的用户体验。
迁移、定价与部署
2026 年 8 月 5 日,grok-voice-latest 别名将自动从 1.0 版本过渡到 2.0 版本。希望保留在 1.0 版本的用户必须在该日期之前将其实施固定在 grok-voice-think-fast-1.0 上。
Pricing: Grok Voice Think Fast 2.0 的价格为每分钟音频 $0.08。
Real-world Impact: 在 Starlink 服务的 A/B 测试中,部署该模型显著提高了销售转化率和支持遏制率 (support containment rates)。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch