Grok 4.5 发布说明

xAI 已发布 Grok 4.5,该模型专为高性能编码、代理任务和知识工作而设计。该模型被定位为 xAI 目前最强的模型,由 xAI 与 Cursor 合作开发。

工程与编码性能

Grok 4.5 在真实世界工程任务中展现出强大能力,尤其是在软件工程基准测试中表现突出。它在特定的解决率上超越了多个领先模型,尽管其性能在不同评估框架中有所差异。

基准测试结果

  • SWE Marathon (pass@1): Grok 4.5 达到 29.0% 的解决率,超过 Opus 4.8 (max) 的 26.0% 和 Fable (max) 的 24.0%。
  • Terminal Bench 2.1: Grok 4.5 得分为 83.3%,紧随 Fable (max) 的 84.3% 和 GPT 5.5 (xhigh) 的 83.4% 之后。
  • SWE Bench Pro: Grok 4.5 达到 64.7% 的解决率,优于 Opus 4.7 (max) 的 64.3%、GLM 5.2 的 62.1% 和 GPT 5.5 (xhigh) 的 58.6%。
  • DeepSWE 1.0: Grok 4.5 得分为 62.0%,落后于 Fable (max) 的 66.1% 和 GPT 5.5 (xhigh) 的 64.31%。
  • DeepSWE 1.1: Grok 4.5 得分为 53%,落后于 Fable (max) 的 70%、GPT 5.5 (xhigh) 的 67% 和 Opus 4.8 (max) 的 59%。

技术训练与基础设施

Grok 4.5 使用数以万计的 NVIDIA GB300 GPU 进行训练。训练过程通过去重、质量评分和领域聚焦选择,强调数据质量而非数据量,以保持高信号数据混合。

强化学习与代理能力

为提升每 token 的智能水平,xAI 在数十万项任务上扩展了强化学习(RL)。该 RL 训练专注于多步骤软件工程和技术工作,采用自动化和基于模型的评分机制。训练架构支持高度异步操作,使代理部署可运行数小时,同时 GPU 集群中的学习持续进行。

效率与服务速度

Grok 4.5 的服务速度为每秒 80 个 token(TPS)。其具有高 token 效率,完成任务所需的 token 数量显著少于竞争对手。

在 SWE Bench Pro 任务中,Grok 4.5 平均使用 15,954 个输出 token 即可完成任务,约为 Opus 4.8 (max) 所需 67,020 个 token 的 4.2 倍少。

办公生产力与集成

Grok 4.5 是 Grok Build 的默认模型,并已集成至 Cursor。它将技术能力扩展至办公软件,包括:

  • Excel: 构建包含网络研究、多工作表公式和内部注释的复杂模型。
  • PowerPoint: 使用原生形状创建复杂图表并设计幻灯片内容。
  • Word: 撰写清晰的论述并撰写业务评审大纲。

定价与可用性

  • 定价: 输入 token 定价为每百万 2 美元,输出 token 定价为每百万 6 美元。
  • 可用性: 该模型可通过 Grok Build、Cursor(所有计划)以及 SpaceXAI 控制台 API 获取。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch