xAI Grok 4.7 发布:功能、基准测试与社区反应
Grok 4.7 在与 4.6 相同的价格下提供更强的长上下文编码能力和安全性
xAI 于 2026‑09‑21 宣布推出 Grok 4.7,定位为 Grok 系列中功能最强的编码与知识工作模型。该模型的输入和输出定价与 Grok 4.6 保持一致,均为每百万输入令牌 2 美元,每百万输出令牌 6 美元,但声称具备更长的推理窗口、更好的自我验证能力,以及公司迄今为止最强的安全防护体系。
核心技术改进
- 更大的基础模型:根据社区推测,Grok 4.7 的架构比 4.6 更大,参数量大约多出 40 %。
- 延长的强化学习训练:强化学习阶段被延长,并更侧重于多小时任务,从而提升了在需要长时间代码生成的基准测试中的表现(例如 CursorBench 4.0)。
- 原生 Grok Bot 集成:模型现在可直接理解 Grok Bot 框架,提升了对话和通用知识任务的表现。
- 增强的自我检查能力:新增的验证循环使模型能更可靠地发现自身错误,这是报告中安全性能提升的关键因素。
基准测试表现概览
| 基准测试 | Grok 4.7 | Grok 4.6 | GPT‑5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| CursorBench 4.0(软件工程) | 46.3 % | 40.4 % | 41.7 % | 51.8 % |
| DeepSWE v1.1(软件工程,高投入) | 71.0 %* | 65.2 % | 72.7 % | 70.0 % |
| EEBench(电气工程) | 64.0 % | 53.0 % | 39.4 % | 56.4 % |
| AA Briefcase v1.1(多小时办公任务) | 1,657 分 | 1,546 分 | 1,487 分 | 1,678 分 |
| Terminal‑Bench 4.0(多小时终端任务) | 38.0 % | 20.3 % | 37.3 % | 57.9 % |
| Harvey Legal Agent | 19.6 % | 15.8 % | 2.5 % | 6.7 % |
| HealthBench Professional | 56.7 % | 48.5 % | 60.5 % | 62.1 % |
*高投入得分。
核心结论:Grok 4.7 在大多数工程与专业工作基准测试中领先其自身系列,尤其在长上下文任务中表现突出,同时在价格上仍与前代保持竞争力。
安全性与双重用途控制
- 全新防护体系:发布说明称,这是迄今为止最强的拒绝请求与越狱抵抗能力。
- HackerBench v0.3:Grok 4.7 仅允许 3.3 % 的高风险双重用途提示通过,同时仍允许合法的安全研究。
- LatchBio 生物安全基准测试:该模型得分为 62.4 %,在评估的前沿模型中最高。
- 红队访问权限:部分网络安全合作伙伴可获得邀请制访问 Grok 4.7 的防御能力。
定价与可用性
- 令牌定价:每百万输入令牌 2 美元,每百万输出令牌 6 美元(与 Grok 4.6 完全相同)。一个“快速”版本价格翻倍,输出速度提升一倍。
- 访问途径:可通过 Cursor、Grok Build、Grok API、第三方编码框架以及云模型路由器使用。
- 免费试用:用户可访问 x.ai/build 试用 Grok Build。
Hacker News 社区反应
正面评价
- 长时间编码任务:用户报告 Grok 4.6 已能处理复杂的构建根环境;许多人预期 4.7 将在此基础上进一步提升。
- 前端开发:多位评论者称赞 Grok 快速生成 HTML/CSS/JS 代码片段的能力。
- 安全性感知:新防护体系被视为双重用途领域的重要进步。
批评与担忧
令牌效率下降:多位评论者指出输出令牌消耗显著上升(例如,CursorBench 得分为 46 % 时消耗 2.4 亿令牌,而 4.6 仅消耗 9700 万),表明尽管定价不变,模型效率反而降低。
"与 Grok 4.6 相比,令牌效率出现显著退步,这由 artificialanalysis.ai 智能指数对比所揭示。" – @notduckrabbit
基准测试相关性存疑:部分用户质疑对比模型的选择(如 GPT‑5.6 Sol、Fable 5.1),并指出未包含如 Kimi 或 DeepSeek 等中文模型。
"为什么没有将 Kimi、Deepseek 等中国模型加入对比基准?" – @shdtabasum
缓存定价不透明:公开价格表仅列出输入/输出费率,缓存读取成本未披露,引发价格欺诈指控。
"每次 Grok 发布都会掩盖其缓存定价,同时突出输入/输出定价……长时间代理工作流主要由缓存读取主导。" – @GodelNumbering
性能与成本权衡不佳:用户报告快速版本价格翻倍,但速度提升不明显,且缓存惩罚使 Grok 比 DeepSeek 4.1 Flash 等替代方案更昂贵。
"Grok 实在太贵了。我用 DeepSeek 4.1 Flash 花费不到一半的价格就获得了极佳的效果。" – @meerita
基准测试结果参差不齐:尽管 Grok 4.7 在多数任务上优于 4.6,但在某些专业基准测试(如图像转 HTML 生成、全知性测试)中仍落后于 Astra 和 Gemini 3.8 Flash 等对手。
"Astra 真是不同凡响。虽然贵,但我的任务用的令牌少得多。" – @saejox "Grok 4.7 在 Redactle LLM 排行榜上接近顶端,但仍不如 Gemini 3.8 Flash。" – @pampas
用户体验退步:部分早期用户观察到响应速度变慢、令牌消耗更高,导致订阅计划中的配额更快耗尽。
"4.7 肯定更慢也更贵……今天我用它做基准测试,进展非常缓慢。" – @mchusma
混合反馈对前沿发展的启示
- 基准提升有限:Grok 4.7 的主要改进(如 CursorBench 提升 6 %)虽真实存在,但并非颠覆性突破;在多个任务上仍落后于顶尖前沿模型。
- 定价策略至关重要:在保持输入/输出费率不变的同时增加令牌消耗,可能削弱成本效益,尤其对重度使用开发者和代理而言。
- 安全优势是差异化关键:迄今为止最强的越狱抵抗能力,可能使 Grok 4.7 在受监管行业中更具吸引力,尽管其令牌消耗更高。
- 社区监督日益严格:用户要求在缓存定价、基准测试方法和真实世界令牌效率方面提高透明度,预示未来发布需更清晰的成本披露。
总结
Grok 4.7 通过更长的上下文窗口、更好的自我验证能力以及公司迄今最强大的安全防护体系,推动了 xAI 编码导向模型的发展。然而,有限的基准提升、更高的令牌消耗以及不透明的缓存定价,引发了开发者的分歧反应。该模型的价值主张如今取决于其安全保证和长时间任务表现,是否足以抵消实际工作负载中增加的运营成本。
Sources
- HNGrok 4.7
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch