SpaceXAI Grok 4.6 发布:智能前沿与成本效率

Grok 4.6 以高性价比加入智能前沿

SpaceXAI 的 Grok 4.6 在 Artificial Analysis Intelligence Index 上获得了 61 分,使其与 GPT-5.6 Sol (max) 持平,仅次于 Anthropic 的 Claude Opus 5 (63) 和 Claude Fable 5 (62)。此次发布标志着智能水平的重大飞跃,比 Grok 4.5 高出 5 分,比 Grok 4.3 高出 23 分。

智能体性能与现实世界知识工作

Grok 4.6 在智能体任务(agentic tasks)而非静态推理方面展现出最强的能力。它实现了 1753 的 GDPval-AA v2 Elo 分数,仅次于 Claude Opus 5,并在统计学上与 Claude Fable 5 和 Qwen3.8 Max 不分伯仲。

关键性能指标包括:

  • $\tau^3$-Banking: 获得 50.7% 的分数,在涉及工具使用的多轮客户服务方面,与 Qwen3.8 Max (51.3%) 并列位列前二。
  • Terminal-Bench v2.1: 获得 88.4% 的分数,在基于终端的软件任务方面表现与领先模型持平。
  • AA-Briefcase: 在这项针对长程智能体知识工作的私有基准测试中,Grok 4.6 获得了 1577 的 Elo 分数(Fable 5 级别)。

值得注意的是,Grok 4.6 的轮次效率极高。在 AA-Briefcase 上,它完成任务大约需要 53 轮,平均使用 ~0.5B 输入 token,而 Claude Opus 5 (max) 则需要 ~103 轮和 ~2.0B 输入 token。

定价与单任务成本优势

Grok 4.6 保持了与 Grok 4.5 相同的标价,这在获得前沿级智能提升的情况下是非常罕见的。其定价为每 1M 输入 token 2 美元,每 1M 输出 token 6 美元,比 Claude Opus 5 ($5/$25) 和 GPT-5.6 Sol ($5/$30) 低 60% 以上。

根据 Artificial Analysis 的数据,Grok 4.6 的单任务成本为 0.84 美元,使其处于 Intelligence vs. Cost per Task 的 Pareto 前沿面。

虽然标价保持不变,但缓存命中(cache hit)定价已从 Grok 4.5 的每 1M token 0.3 美元增加到 Grok 4.6 的每 1M token 0.5 美元。

技术规格

  • Context Window: 500k tokens (与 Grok 4.5 保持一致)。
  • Pricing: $2/$6 per 1M input/output tokens。
  • Cache Hits: $0.5 per 1M tokens.

用户视角与社区洞察

社区讨论揭示了用户在专业工作流中使用该模型的体验和对模型效用的感知存在分歧:

  • 编程与生产力: 一些用户报告说,Grok 4.6(特别是在通过 Grok build CLI 或在 Cursor 中使用时)比 Claude Code 更快且更具交互性。一位用户指出,Grok 的沟通风格更加简洁,避免了“文本墙”,避免了“文本墙”,允许在会话期间进行更多引导。
  • 基础设施优势: 观察者认为,SpaceXAI 拥有自己的算力和数据中心,这可能在降低 token 成本和改进工具集成方面提供长期优势。
  • 工具使用: 用户观察到 Grok 4.6 在视觉验证任务方面的倾向性有所提升(例如,通过截图),使其能力更接近 Claude Opus 5 和 Fable 系列。
  • Criticisms: 一些用户对该模型在编程领域的应用仍持怀疑态度,而另一些用户则对 Grok 训练过程中使用便携式燃气发电机带来的环境影响表示担忧。

"Grok 4.6 though is no longer 'smart and fast'. It's about as fast as Sol though. A big improvement I noticed in 4.6 was tool use for verification... Now Grok is probably right behind them, perhaps tied with Claude Fable 5 and Qwen3.8 Max on propensity to verify visually."

"I've been using grok 4.5 with grok build soon after it came out and dropped claude... It doesn't give me a wall of text, tells me what I need to know and I'll make the actual decisions."

"In my experience in heavy coding sessions, most pricing is just cache read and cache write like 80% of my token bill." }

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch