xAI Grok 4.7 发布说明
xAI 已发布 Grok 4.7,该模型专为复杂编程和专业知识工作优化。与前代模型 Grok 4.6 相比,Grok 4.7 采用了更大的基础模型,并通过专注于需要数小时完成的任务的训练方案进行优化。
技术改进与训练
Grok 4.7 基于比 Grok 4.6 更大的基础模型,并使用更长的强化学习训练流程进行训练。此次训练聚焦于更具挑战性的任务组合,特别强调那些需要数小时完成的问题,从而提升模型自我验证能力并更好地处理长上下文。
此外,xAI 还训练 Grok 4.7 原生理解 Grok Bot 框架,进一步提升了其在通用知识工作和对话任务中的表现。
性能基准测试
Grok 4.7 在多个专业和专业技术基准测试中相较于 Grok 4.6 有显著提升。其在价格性能方面表现极具竞争力,尤其是在 CursorBench 4.0 的长时间编程任务中表现突出。
软件与电气工程
- CursorBench 4.0:Grok 4.7 得分为 46.3%,高于 Grok 4.6 的 40.4%。
- DeepSWE v1.1:Grok 4.7 达到 71.0%(高难度),优于 Grok 4.6 的 65.2%。
- EEBench:Grok 4.7 得分为 64.0%,显著高于 Grok 4.6 的 53.0% 和 GPT-5.6 Sol Max 的 39.4%。
专业知识工作
- AA Briefcase v1.1:Grok 4.7 得分为 1,657,优于 Grok 4.6 的 1,546。
- Harvey Legal Agent Benchmark:Grok 4.7 得分为 19.6%,远超 Grok 4.6 的 15.8%,更远高于 GPT-5.6 Sol Max 的 2.5% 和 Fable 5.1 Max 的 6.7%。
- HealthBench Professional:Grok 4.7 得分为 56.7%,高于 Grok 4.6 的 48.5%。
- Terminal-Bench 4.0:Grok 4.7 得分为 38.0%,远高于 Grok 4.6 的 20.3%。
安全性与网络安全
Grok 4.7 实施了全新的安全防护体系,使其成为 xAI 测试过的在抵御越狱攻击和拒绝请求方面最强的模型。
生物安全与网络安全
- 生物安全:在 LatchBio 的生物安全基准测试中,Grok 4.7 以 62.4% 的得分位居榜首。
- 网络安全:在 HackerBench v0.3 测试中,Grok 4.7 仅允许 3.3% 的高风险双重用途提示通过,同时保持对合法安全工作的低拒绝率。
为支持防御研究,xAI 已向选定的网络安全合作伙伴提供模型红队能力的邀请制访问权限。
定价与可用性
Grok 4.7 可通过 Grok API、Grok Build、Cursor、第三方编程框架、模型路由器以及云平台获取。
定价结构:
- 标准版:每百万输入 token 2 美元,每百万输出 token 6 美元。
- 快速版:输出速度为标准版的两倍,价格也为标准版的两倍。
Sources
- OriginalIntroducing Grok 4.7