Grok 4.6 发布说明:智能体编程与前沿智能

Grok 4.6 为智能体工作流提供前沿智能

Grok 4.6 专为长时运行的智能体以及宏大的交互式和视觉化工作而设计,使模型能够在多个步骤中维持复杂的任务。它在研究课题、分析信息、浏览大型代码库以及将产品构想转化为成熟应用方面特别有效。

在 Artificial Analysis Intelligence Index(由九项基准测试组成的综合评分)上,Grok 4.6 以 61 分的成绩与 GPT-5.6 Sol 持平。它在智能体编程和知识工作基准测试中也表现出强劲的性能,特别是在以下领域相比 Grok 4.5 有所提升:

  • GDPVal-AA v2: 1753 (高于 Grok 4.5 的 1526)
  • CursorBench v3.2: 69.9% (高于 Grok 4.5 的 66.7%)
  • DeepSWE v1.1: 65.9% (高于 Grok 4.5 的 54%)
  • FrontierCode v1.1 (Extended): 61.3% (高于 Grok 4.5 的 56.6%)
  • APEX-Agents: 57.5% (高于 Grok 4.5 的 47.1%)

训练与 RL 中的技术改进

Grok 4.6 利用了更长的补充训练周期和精细的数据策展来提高推理和技术能力。 训练过程涉及几个关键阶段:

  1. 基础训练 (Foundation Training): xAI 使用了针对高级技术概念和推理的精选模型生成数据,并结合了高质量的工程数据以及改进的优化器/训练方案。
  2. SFT (Supervised Fine-Tuning): 使用 Grok 4.5 来重新生成涵盖 STEM、软件工程和知识工作的 SFT 轨迹。随后使用基于模型的检查来过滤掉有问题的轨迹。
  3. 智能体 RL (Agentic RL): 模型在广泛的强化学习任务上进行了训练,包括通用编程和针对 Web 开发、内核优化以及计算机辅助设计 (CAD) 的领域特定环境。

项目开发能力的增强

Grok 4.6 经过优化,能够以极少的迭代将广泛的产品构想转化为可运行的首个版本。 与 Grok 4.5 相比,该模型在单次运行中建立应用程序结构和视觉语言的能力更强。

关键行为改进包括:

  • 自我验证 (Self-Verification): 在较长的轨迹中,模型在进入下一步之前会更频繁地对自己的工作进行自我测试和验证。
  • 视觉/交互强度 (Visual/Interactive Strength): 模型在视觉项目中能产生更高质量的首版结果,减少了对大量初始迭代的需求。

安全与部署

Grok 4.6 的安全栈已进行校准,以最大限度地提高其在合法工程和研究用例中的效用。 这包括允许模型在漏洞修补等领域提供帮助,并加速工程设计周期。xAI 报告称,使用了其有史以来最广泛的部署前测试套件以及广泛的第三方测试来校准这些防护措施。

可用性与定价

Grok 4.6 可通过 SpaceXAI API、Grok Build 和 Cursor 使用。 它也可以通过包括 OpenRouter、Vercel 和 Cloudflare 在内的合作伙伴进行访问。

  • 标准定价: $2 每百万输入 token;$6 每百万输出 token。
  • 快速变体 (Fast Variant): 以两倍的标准价格提供。
  • 促销活动: Grok Build 和 Cursor 的用户在发布的第一周内将获得 2 倍的包含使用量。

社区洞察与不同观点

虽然官方基准测试显示其与其他前沿模型持平,但来自 Hacker News 的社区反馈对实际体验呈现出不同的看法:

性能与效率

某些用户报告 Grok 4.6 比竞争对手更简洁,且“直奔主题”,而其他人则认为它在 token 使用效率上不如 GPT-5.6 Sol。

"[Grok 4.5] just gets to the point, and is super fast and concise, no yapping... None of the weird 'Claude ipsum' jargon... or GPT 5.6-isms."

相反,一些早期采用者发现该模型比其前代产品更慢,且遵循复杂指令的能力较弱:

"I've had a few interactions with it through cursor and first impression is: I'm underwhelmed. The plans it produces are all over the place and hard to follow... Grok 4.5 produced better plans."

信任与治理

关于 xAI 领导层的信任度存在大量讨论。一些用户出于对数据隐私和 Elon Musk 个人参与公司运营的担忧,表达了对其他实验室的偏好。

API 实现

技术用户指出,SpaceXAI API 似乎在注入一个默认的系统提示词,该提示词优先考虑特定的安全准则(例如拒绝编写漏洞利用程序或恶意软件)而非用户提供的系统指令,偶尔会导致模型拒绝讨论系统提示词本身。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch