Grok 4.6 发布说明 / 更新内容

xAI 发布了 Grok 4.6,这是一个专门为长时运行智能体(agents)以及复杂的交互式和视觉化工作而优化的模型。该模型旨在为代码库分析、深度研究和精细化应用开发等多步任务提供持续的进展能力。

在智能体编程与知识工作方面的尖端性能

Grok 4.6 在多个智能体基准测试中达到了前沿水平的智能,在汇总了九个不同基准测试的 Artificial Analysis (AA) Intelligence Index 上,其表现与 GPT-5.6 Sol 持平。

根据提供的评估数据,Grok 4.6 在多个指标上较 Grok 4.5 有显著提升:

Benchmark Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 (Ext) 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

技术训练方法论

Grok 4.6 是通过一个多阶段训练过程开发的,旨在加强其推理和技术执行的基础能力。

补充训练与优化

该模型经历了比其前身 Grok 4.5 更长时间的补充训练运行。这一阶段利用了改进的优化器和训练方案,并结合了高质量的工程数据以及专注于先进技术概念和推理的精选模型生成数据。

SFT 与 RL 精炼

xAI 使用 Grok 4.5 来重新生成涵盖软件工程、STEM、知识工作和智能体框架(agent harnesses)的监督微调(SFT)轨迹。这些轨迹通过基于模型的检查进行过滤,以移除存在问题的轨迹。在 SFT 之后,该模型在广泛的智能体强化学习(RL)任务上进行了训练,包括:

  • 通用编程与知识工作。
  • 针对 Web 开发和计算机辅助设计(CAD)的特定领域环境。
  • 内核优化。

增强的智能体能力与视觉化工作

Grok 4.6 展示了处理长轨迹项目的能力有所提升,特别是在将宽泛的产品构思转化为功能性的初版版本方面。

迭代开发与自我验证

该模型可以研究不熟悉的领域、构建应用结构并实现核心交互。在处理较长任务时,Grok 4.6 表现出诸如自我测试和验证等涌现行为,即模型在进行下一步之前会先检查自己的工作。

视觉与交互式项目

Grok 4.6 与 Grok 4.5 相比,为视觉化项目提供了更强的初始构建能力,能够在单次运行中建立起应用的结构和视觉语言。这使得用户可以从一个坚实的基础开始并进行快速迭代。

安全与部署

Grok 4.6 的安全防护措施已根据模型扩展的能力进行了校准。安全堆栈旨在在保持安全性的同时,最大限度地提高合法高技术使用场景(如 AI 研究、工程设计周期和漏洞修补)的效用。部署前测试包括了 xAI 迄今为止最广泛的能力与防护措施校准套件,并辅以部署后的测试和第三方测试。

可用性与定价

Grok 4.6 可通过以下平台使用:

  • 集成: Cursor 和 Grok Build(首周包含 2 倍使用额度)。
  • API: 可通过 SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 使用。

定价结构:

  • Standard: 每百万输入 token 2 美元 / 每百万输出 token 6 美元。
  • Fast Variant: 价格为标准版的两倍。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch