SpaceXAI Grok 4.6 リリース: 知能の最前線とコスト効率
Grok 4.6 は高いコスト効率とともに知能の最前線に加わる
SpaceXAIの Grok 4.6 は、Artificial Analysis Intelligence Index で 61 というスコアを獲得し、GPT-5.6 Sol (max) と肩を並べ、Anthropic の Claude Opus 5 (63) と Claude Fable 5 (62) にのみ次ぐ結果となりました。このリリースは、Grok 4.5 から 5 ポイント、Grok 4.3 から 23 ポイントの知能の向上を記録しており、大幅な飛躍を意味します。
エージェント性能と実世界の知識ワーク
Grok 4.6 は、静的な推論よりもエージェント的なタスクにおいて最も強力な能力を発揮します。GDPval-AA v2 Elo で 1753 を達成し、Claude Opus 5 に次ぐ位置にあり、Claude Fable 5 や Qwen3.8 Max と統計的に区別がつかないレベルに達しています。
主なパフォーマンス指標は以下の通りです:
- $\tau^3$-Banking: スコア 50.7% で、ツール使用を伴うマルチターン・カスタマーサービスにおいて、Qwen3.8 Max (51.3%) と並びトップ2のモデルにランクインしています。
- Terminal-Bench v2.1: スコア 88.4% で、ターミナルベースのソフトウェアタスクにおいて、主要モデルと同等の性能を発揮しています。
- AA-Briefcase: 長期的なエージェント的知識ワークのためのプライベート・ベンチマークにおいて、Grok 4.6 は Elo 1577 (Fable 5-tier) を獲得しました。
特筆すべきは、Grok 4.6 が非常にターン効率が高いことです。AA-Briefcase において、Claude Opus 5 (max) が約 103 ターン、約 2.0B 入力トークンを使用するのに対し、Grok 4.6 は約 53 ターンでタスクを完了し、平均して約 0.5B 入力トークンを使用します。
価格設定とタスクあたりのコストの優位性
Grok 4.6 は、最前線の知能向上を達成しながらも、Grok 4.5 と同じ見出し価格を維持しています。これは、最前線のモデルレベルでの知能向上としては異例のことです。価格は入力 1M トークンあたり $2、出力 1M トークンあたり $6 で、これは Claude Opus 5 ($5/$25) や GPT-5.6 Sol ($5/$30) よりも 60% 以上安価です。
Artificial Analysis によると、Grok 4.6 のタスクあたりのコストは $0.84 であり、Intelligence vs. Cost per Task Pareto frontier に位置しています。見出し価格は据え置きですが、キャッシュ・ヒット価格は Grok 4.5 の 1M トークンあたり $0.3 から Grok 4.6 の 1M トークンあたり $0.5 に上昇しました。
技術仕様
- Context Window: 500k トークン (Grok 4.5 から変更なし)。
- Pricing: 入力/出力 1M トークンあたり $2/$6。
- Cache Hits: 1M トークンあたり $0.5。
ユーザーの視点とコミュニティの洞察
コミュニティの議論では、ユーザー体験と、プロフェッショナルなワークフローにおけるモデルの有用性に関する認識に分かれが見られます:
- Coding と Productivity: 一部のユーザーは、Grok 4.6 が、特に Grok build CLI や Cursor 内で使用する場合、Claude Code よりも高速でインタラクティブであると報告しています。あるユーザーは、Grok のコミュニケーション・スタイルがより簡潔潔明、「text walls」を避けて、セッション中のより的確な指示(steering)が可能になると述べています。
- Infrastructure Advantage: 観察者たちは、SpaceXAI が自前のコンピューティング・リソースとデータセンターを所有していることが、トークン・コストの削減とツール統合の向上において、長期的な優位性をもたらす可能性があると示唆しています。
- Tool Use: ユーザーは、Grok 4.6 がタスクを視覚的に検証する傾向(例:スクリーンショットの撮影)が向上したことを観察しており、これにより Claude Opus 5 や Fable ファミリーの能力に近接しています。
- Criticisms: 一部のユーザーは、コーディングにおけるモデルの採用に懐疑的なままであり、一方で、他のユーザーは、ポータブル・ガス・ジェネレーターの使用による Grok のトレーニングによる環境への影響を懸念しています。
"Grok 4.6 though is no longer 'smart and fast'. It's about as fast as Sol though. A big improvement I noticed in 4.6 was tool use for verification... Now Grok is probably right behind them, perhaps tied with Sol on propensity to verify visually."
"I've been using grok 4.5 with grok build soon after it came out and dropped claude... It doesn't give me a wall of text, tells me what I need to know and I'll make the actual decisions."
"In my experience in heavy coding sessions most pricing is just cache read and cache write like 80% of my token bill." }
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch