xAI Grok 4.7 发布说明

xAI 已发布 Grok 4.7,该模型专为复杂编程和专业知识工作优化。与前代模型 Grok 4.6 相比,Grok 4.7 采用了更大的基础模型,并通过专注于需要数小时完成的任务的训练方案进行优化。

技术改进与训练

Grok 4.7 基于比 Grok 4.6 更大的基础模型,并使用更长的强化学习训练流程进行训练。此次训练聚焦于更具挑战性的任务组合,特别强调那些需要数小时完成的问题,从而提升模型自我验证能力并更好地处理长上下文。

此外,xAI 还训练 Grok 4.7 原生理解 Grok Bot 框架,进一步提升了其在通用知识工作和对话任务中的表现。

性能基准测试

Grok 4.7 在多个专业和专业技术基准测试中相较于 Grok 4.6 有显著提升。其在价格性能方面表现极具竞争力,尤其是在 CursorBench 4.0 的长时间编程任务中表现突出。

软件与电气工程

  • CursorBench 4.0:Grok 4.7 得分为 46.3%,高于 Grok 4.6 的 40.4%。
  • DeepSWE v1.1:Grok 4.7 达到 71.0%(高难度),优于 Grok 4.6 的 65.2%。
  • EEBench:Grok 4.7 得分为 64.0%,显著高于 Grok 4.6 的 53.0% 和 GPT-5.6 Sol Max 的 39.4%。

专业知识工作

  • AA Briefcase v1.1:Grok 4.7 得分为 1,657,优于 Grok 4.6 的 1,546。
  • Harvey Legal Agent Benchmark:Grok 4.7 得分为 19.6%,远超 Grok 4.6 的 15.8%,更远高于 GPT-5.6 Sol Max 的 2.5% 和 Fable 5.1 Max 的 6.7%。
  • HealthBench Professional:Grok 4.7 得分为 56.7%,高于 Grok 4.6 的 48.5%。
  • Terminal-Bench 4.0:Grok 4.7 得分为 38.0%,远高于 Grok 4.6 的 20.3%。

安全性与网络安全

Grok 4.7 实施了全新的安全防护体系,使其成为 xAI 测试过的在抵御越狱攻击和拒绝请求方面最强的模型。

生物安全与网络安全

  • 生物安全:在 LatchBio 的生物安全基准测试中,Grok 4.7 以 62.4% 的得分位居榜首。
  • 网络安全:在 HackerBench v0.3 测试中,Grok 4.7 仅允许 3.3% 的高风险双重用途提示通过,同时保持对合法安全工作的低拒绝率。

为支持防御研究,xAI 已向选定的网络安全合作伙伴提供模型红队能力的邀请制访问权限。

定价与可用性

Grok 4.7 可通过 Grok API、Grok Build、Cursor、第三方编程框架、模型路由器以及云平台获取。

定价结构:

  • 标准版:每百万输入 token 2 美元,每百万输出 token 6 美元。
  • 快速版:输出速度为标准版的两倍,价格也为标准版的两倍。

Sources