SpaceXAI Grok 4.6 發佈:智能前沿與成本效率
Grok 4.6 以高成本效益加入智能前沿
SpaceXAI 的 Grok 4.6 在 Artificial Analysis Intelligence Index 上獲得了 61 分,使其與 GPT-5.6 Sol (max) 並駕齊驅,僅次於 Anthropic 的 Claude Opus 5 (63) 和 Claude Fable 5 (62)。此次發佈標誌著智能水平的重大躍升,比 Grok 4.5 高出 5 分,比 Grok 4.3 高出 23 分。
代理性能與現實世界的知識工作
Grok 4.6 在代理任務(agentic tasks)而非靜態推理方面展現了最強大的能力。它在 GDPval-AA v2 的 Elo 分數為 1753,僅次於 Claude Opus 5,且在統計學上與 Claude Fable 5 和 Qwen3.8 Max 無異。
關鍵性能指標包括:
- $\tau^3$-Banking: 分數為 50.7%,在具備工具使用的多輪客戶服務方面,與 Qwen3.8 Max (51.3%) 並列前二。
- Terminal-Bench v2.1: 分數為 88.4%,在基於終端機的軟體開發任務中表現與領先模型相當。
- AA-Briefcase: 在此項針對長週期代理知識工作的私有基準測試中,Grok 4.6 獲得了 1577 的 Elo 分數(Fable 5 級別)。
值得注意的是,Grok 4.6 的回合效率極高。在 AA-Briefcase 中,它大約在 53 個回合內完成任務,平均使用約 0.5B input tokens,而 Claude Opus 5 (max) 則需要約 103 個回合和約 2.0B input tokens。
定價與每任務成本優勢
Grok 4.6 維持與 Grok 4.5 相同的標題定價,這對於達到前沿智能水平的提升而言相當罕見。其定價為每 1M input tokens $2,每 1M output tokens $6,比 Claude Opus 5 ($5/$25) 和 GPT-5.6 Sol ($5/$30) 低 60% 以上。
根據 Artificial Analysis 的數據,Grok 4.6 的每任務成本為 $0.84,使其位居於 Intelligence vs. Cost per Task 的 Pareto 前沿面。
技術規格
- Context Window: 500k tokens (與 Grok 4.5 相同)。
- Pricing: $2/$6 per 1M input/output tokens。
- Cache Hits: $0.5 per 1M tokens。
用戶觀點與社群洞察
社群討論揭示了用戶在專業工作流中使用該模型的體驗與對其效用的感知存在分歧:
- 編碼與生產力: 一些用戶報告說,Grok 4.6(特別是當透過 Grok build CLI 或在 Cursor 中使用時)比 Claude Code 更快且更具互動性。一位用戶指出,Grok 的溝通風格更簡潔,避免了「文字牆」,避免了「文字牆」,並允許在對話期間進行更多引導。
- 基礎設施優勢: 觀察者指出,SpaceXAI 的自有運算力與數據中心所有權可能在降低 token 成本與提升工具集成能力方面提供長期優勢。
- 工具使用: 用戶觀察到 Grok 4.6 在視覺化驗證任務的傾向性方面有所提升(例如,透過截圖),使其能力更接近 Claude Opus 5 和 Fable 系列。
"Grok 4.6 雖然不再是『智能與快速』,但它與 Sol 的速度相當。我在 4.6 中注意到的一個重大改進是工具使用進行驗證... 現在 Grok 可能緊隨其後,在視覺化驗證的傾向性上或許與 Sol 持平。"
"我一直在使用 grok 4.5 與 grok build,在它剛推出後不久就棄用了 claude... 它不會給我一堆文字牆,它會告訴我我需要知道的內容,而實際的決策是由我來做。"
"在我的經驗中,在繁重的編碼作業中,大部分定價是 cache read 與 cache write,佔了我 token 帳單 80% 的部分。"
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch