Grok 3 Beta 发布说明 / 新特性
xAI 推出了 Grok 3 Beta,这是一个将广泛的预训练知识与先进的推理能力相结合的模型系列。Grok 3 在 Colossus 超级集群上进行训练,使用的计算量是之前最先进模型的 10 倍,在数学、编程、世界知识和指令遵循任务方面表现出了显著的提升。
通过测试时计算实现先进推理
Grok 3 引入了专门的推理模型,Grok 3 (Think) 和 Grok 3 mini (Think),它们利用大规模强化学习 (RL) 来优化其思维链过程。这些模型可以采用测试时计算 (test-time compute),在交付最终答案之前,花费从几秒钟到几分钟的时间进行回溯、纠错并探索多种解题策略。
推理模型的性能基准测试包括:
- AIME 2025: Grok 3 (Think) 在使用最高级别的测试时计算 (cons@64) 时达到了 93.3%。
- GPQA (研究生级专家推理): Grok 3 (Think) 达到了 84.6%。
- LiveCodeBench: Grok 3 (Think) 在代码生成和问题解决方面达到了 79.4%。
- AIME 2024: Grok 3 mini 达到了 95.8%。
- LiveCodeBench: Grok 3 mini 在 STEM 任务中达到了 80.4%。
用户可以通过 "Think" 按钮访问这些功能,该按钮通过允许用户检查模型的内部推理过程,从而提供完全的透明度。
预训练与通用性能
当推理功能被禁用时,Grok 3 提供高质量、即时的响应,并在非推理模型中取得了最先进的结果。它具有 100 万 token 的上下文窗口,比之前的 xAI 模型大八倍,增强了其处理大量文档并保持指令遵循准确性的能力。
关键基准测试的对比性能(Grok 3 Beta 对比 竞争对手):
| Benchmark | Grok 3 Beta | Gemini 2.0 | DeepSeek-V3 | GPT 4o | Claude 3.5 Sonnet |
|---|---|---|---|---|---|
| AIME’24 | 52.2% | — | 39.2% | 9.3% | 16.0% |
| GPQA | 75.4% | 64.7% | 59.1% | 53.6% | 65.0% |
| LCB | 57.0% | 36.0% | 33.1% | 32.3% | 40.2% |
| MMLU-pro | 79.9% | 79.1% | 75.9% | 72.6% | 78.0% |
| LOFT (128k) | 83.3% | 75.6% | — | 78.0% | 69.9% |
| MMMU | 73.2% | 72.7% | — | 69.1% | 70.4% |
| EgoSchema | 74.5% | 71.9% | — | 72.2% | — |
该模型的早期版本(代号为 chocolate)此前曾以 1402 的 Elo 分数登顶 LMArena Chatbot Arena 排行榜。
Grok Agents 与 DeepSearch
为了将模型的能力扩展到现实世界的交互中,xAI 正在引入 Grok Agents,它们将推理能力与工具使用结合起来,包括互联网访问和代码解释器。
第一个智能体 DeepSearch 旨在从整个人类知识库中综合信息、通过冲突的事实进行推理,并生成全面的报告。它适用于从实时新闻综合到深入科学研究的各种用例。
可用性与路线图
- 用户访问: Grok 3 在 X 和 Grok.com 上的 Premium 和 Premium+ 用户均可使用。Premium+ 用户可以立即访问
Think和DeepSearch功能,并拥有更高的使用限制。 - API 访问: Grok 3 和 Grok 3 mini,包括标准版和推理版,将在未来几周内通过 API 平台发布。
DeepSearch将通过 API 提供给企业合作伙伴。 - Future Development: 训练工作正在进行中。未来对 Enterprise API 的更新将包括工具使用、代码执行以及先进的智能体能力,重点在于可扩展的监督和对抗性鲁棒性。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch