Grok 3 Beta 发布说明 / 新特性

xAI 推出了 Grok 3 Beta,这是一个将广泛的预训练知识与先进的推理能力相结合的模型系列。Grok 3 在 Colossus 超级集群上进行训练,使用的计算量是之前最先进模型的 10 倍,在数学、编程、世界知识和指令遵循任务方面表现出了显著的提升。

通过测试时计算实现先进推理

Grok 3 引入了专门的推理模型,Grok 3 (Think) 和 Grok 3 mini (Think),它们利用大规模强化学习 (RL) 来优化其思维链过程。这些模型可以采用测试时计算 (test-time compute),在交付最终答案之前,花费从几秒钟到几分钟的时间进行回溯、纠错并探索多种解题策略。

推理模型的性能基准测试包括:

  • AIME 2025: Grok 3 (Think) 在使用最高级别的测试时计算 (cons@64) 时达到了 93.3%。
  • GPQA (研究生级专家推理): Grok 3 (Think) 达到了 84.6%。
  • LiveCodeBench: Grok 3 (Think) 在代码生成和问题解决方面达到了 79.4%。
  • AIME 2024: Grok 3 mini 达到了 95.8%。
  • LiveCodeBench: Grok 3 mini 在 STEM 任务中达到了 80.4%。

用户可以通过 "Think" 按钮访问这些功能,该按钮通过允许用户检查模型的内部推理过程,从而提供完全的透明度。

预训练与通用性能

当推理功能被禁用时,Grok 3 提供高质量、即时的响应,并在非推理模型中取得了最先进的结果。它具有 100 万 token 的上下文窗口,比之前的 xAI 模型大八倍,增强了其处理大量文档并保持指令遵循准确性的能力。

关键基准测试的对比性能(Grok 3 Beta 对比 竞争对手):

Benchmark Grok 3 Beta Gemini 2.0 DeepSeek-V3 GPT 4o Claude 3.5 Sonnet
AIME’24 52.2% 39.2% 9.3% 16.0%
GPQA 75.4% 64.7% 59.1% 53.6% 65.0%
LCB 57.0% 36.0% 33.1% 32.3% 40.2%
MMLU-pro 79.9% 79.1% 75.9% 72.6% 78.0%
LOFT (128k) 83.3% 75.6% 78.0% 69.9%
MMMU 73.2% 72.7% 69.1% 70.4%
EgoSchema 74.5% 71.9% 72.2%

该模型的早期版本(代号为 chocolate)此前曾以 1402 的 Elo 分数登顶 LMArena Chatbot Arena 排行榜。

Grok Agents 与 DeepSearch

为了将模型的能力扩展到现实世界的交互中,xAI 正在引入 Grok Agents,它们将推理能力与工具使用结合起来,包括互联网访问和代码解释器。

第一个智能体 DeepSearch 旨在从整个人类知识库中综合信息、通过冲突的事实进行推理,并生成全面的报告。它适用于从实时新闻综合到深入科学研究的各种用例。

可用性与路线图

  • 用户访问: Grok 3 在 X 和 Grok.com 上的 Premium 和 Premium+ 用户均可使用。Premium+ 用户可以立即访问 ThinkDeepSearch 功能,并拥有更高的使用限制。
  • API 访问: Grok 3 和 Grok 3 mini,包括标准版和推理版,将在未来几周内通过 API 平台发布。DeepSearch 将通过 API 提供给企业合作伙伴。
  • Future Development: 训练工作正在进行中。未来对 Enterprise API 的更新将包括工具使用、代码执行以及先进的智能体能力,重点在于可扩展的监督和对抗性鲁棒性。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch