Grok 4.5 发布说明
xAI 已发布 Grok 4.5,该模型专为高性能编码、代理任务和知识工作而设计。该模型被定位为 xAI 目前最强的模型,由 xAI 与 Cursor 合作开发。
工程与编码性能
Grok 4.5 在真实世界工程任务中展现出强大能力,尤其是在软件工程基准测试中表现突出。它在特定的解决率上超越了多个领先模型,尽管其性能在不同评估框架中有所差异。
基准测试结果
- SWE Marathon (pass@1): Grok 4.5 达到 29.0% 的解决率,超过 Opus 4.8 (max) 的 26.0% 和 Fable (max) 的 24.0%。
- Terminal Bench 2.1: Grok 4.5 得分为 83.3%,紧随 Fable (max) 的 84.3% 和 GPT 5.5 (xhigh) 的 83.4% 之后。
- SWE Bench Pro: Grok 4.5 达到 64.7% 的解决率,优于 Opus 4.7 (max) 的 64.3%、GLM 5.2 的 62.1% 和 GPT 5.5 (xhigh) 的 58.6%。
- DeepSWE 1.0: Grok 4.5 得分为 62.0%,落后于 Fable (max) 的 66.1% 和 GPT 5.5 (xhigh) 的 64.31%。
- DeepSWE 1.1: Grok 4.5 得分为 53%,落后于 Fable (max) 的 70%、GPT 5.5 (xhigh) 的 67% 和 Opus 4.8 (max) 的 59%。
技术训练与基础设施
Grok 4.5 使用数以万计的 NVIDIA GB300 GPU 进行训练。训练过程通过去重、质量评分和领域聚焦选择,强调数据质量而非数据量,以保持高信号数据混合。
强化学习与代理能力
为提升每 token 的智能水平,xAI 在数十万项任务上扩展了强化学习(RL)。该 RL 训练专注于多步骤软件工程和技术工作,采用自动化和基于模型的评分机制。训练架构支持高度异步操作,使代理部署可运行数小时,同时 GPU 集群中的学习持续进行。
效率与服务速度
Grok 4.5 的服务速度为每秒 80 个 token(TPS)。其具有高 token 效率,完成任务所需的 token 数量显著少于竞争对手。
在 SWE Bench Pro 任务中,Grok 4.5 平均使用 15,954 个输出 token 即可完成任务,约为 Opus 4.8 (max) 所需 67,020 个 token 的 4.2 倍少。
办公生产力与集成
Grok 4.5 是 Grok Build 的默认模型,并已集成至 Cursor。它将技术能力扩展至办公软件,包括:
- Excel: 构建包含网络研究、多工作表公式和内部注释的复杂模型。
- PowerPoint: 使用原生形状创建复杂图表并设计幻灯片内容。
- Word: 撰写清晰的论述并撰写业务评审大纲。
定价与可用性
- 定价: 输入 token 定价为每百万 2 美元,输出 token 定价为每百万 6 美元。
- 可用性: 该模型可通过 Grok Build、Cursor(所有计划)以及 SpaceXAI 控制台 API 获取。
Sources
- OriginalIntroducing Grok 4.5
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch