Grok 4.6 リリースノート: エージェンティック・コーディングとフロンティア・インテリジェンス

Grok 4.6 はエージェンティックなワークフローにフロンティア・インテリジェンスを提供します

Grok 4.6 は、長時間実行されるエージェントや、野心的なインタラクティブ・ビジュアル作業のために特別に設計されており、モデルが複数のステップにわたって複雑なタスクを維持することを可能にします。トピックの調査、情報の分析、大規模なコードベースのナビゲーション、そして製品のアイデアを洗練されたアプリケーションへと変換することにおいて、特に効果を発揮します。

9つのベンチマークの複合スコアである Artificial Analysis Intelligence Index において、Grok 4.6 はスコア 61 で GPT-5.6 Sol のパフォーマンスに匹敵します。また、エージェンティック・コーディングおよびナレッジワークのベンチマークにおいても強力なパフォーマンスを示しており、特に以下の領域で Grok 4.5 からの改善が見られます:

  • GDPVal-AA v2: 1753 (Grok 4.5 の 1526 から上昇)
  • CursorBench v3.2: 69.9% (Grok 4.5 の 66.7% から上昇)
  • DeepSWE v1.1: 65.9% (Grok 4.5 の 54% から上昇)
  • FrontierCode v1.1 (Extended): 61.3% (Grok 4.5 の 56.6% から上昇)
  • APEX-Agents: 57.5% (Grok 4.5 の 47.1% から上昇)

トレーニングと RL における技術的改善

Grok 4.6 は、推論能力と技術的能力を向上させるために、より長い補完トレーニング・ランと洗練されたデータ・キュレーションを活用しています。 トレーニング・プロセスには、いくつかの主要な段階が含まれています:

  1. Foundation Training: xAI は、高度な技術的概念と推論のために、厳選されたモデル生成データを使用し、高品質なエンジニアリング・データと改良されたオプティマイザ/トレーニング・レシピを組み合わせて使用しました。
  2. SFT (Supervised Fine-Tuning): Grok 4.5 を使用して、STEM、ソフトウェア・エンジニアリング、およびナレッジワークにわたる SFT トラジェクトリを再生成しました。その後、モデルベースのチェックを使用して、問題のあるトレースをフィルタリングしました。
  3. Agentic RL: モデルは、一般的なコーディングから、Web 開発、カーネル最適化、コンピュータ支援設計 (CAD) のドメイン固有の環境を含む、幅広い強化学習タスクでトレーニングされました。

プロジェクト開発のための強化された機能

Grok 4.6 は、広範な製品のアイデアを、最小限の反復で動作する最初のバージョンへと変換するように最適化されています。 このモデルは、Grok 4.5 と比較して、単一のパスでアプリケーションの構造とビジュアル言語を確立するより強力な能力を示しています。

主な行動の改善には以下が含まれます:

  • 自己検証 (Self-Verification): 長いトラジェクトリにおいて、モデルは次のステップに進む前に、自身の作業の自己テストと検証をより頻繁に行います。
  • ビジュアル/インタラクティブな強み: モデルはビジュアル・プロジェクトに対してより高品質な最初のパスを生成し、広範な初期反復の必要性を軽減します。

安全性とデプロイ

Grok 4.6 のセーフティ・スタックは、正当なエンジニアリングおよび研究のユースケースにおける有用性を最大化するように調整されています。 これには、脆弱性のパッチ適用やエンジニアリング設計サイクルの加速といったドメインにおいて、モデルが役立つことを許可することが含まれます。xAI は、これらのガードレールを調整するために、かつてないほど広範なデプロイ前テストと広範なサードパーティ・テストを使用していると報告しています。

利用可能性と価格

Grok 4.6 は、SpaceXAI API、Grok Build、および Cursor を通じて利用可能です。 また、OpenRouter、Vercel、Cloudflare を含むパートナー経由でもアクセス可能です。

  • 標準価格: 入力トークン 100 万件あたり 2ドル、出力トークン 100 万件あたり 6ドル。
  • Fast バリアント: 標準価格の 2 倍で利用可能。
  • プロモーション: Grok Build および Cursor のユーザーは、リリース後の最初の 1 週間、2 倍の利用枠が付与されます。

コミュニティの洞察と対論

公式ベンチマークは他のフロンティア・モデルと同等であることを示していますが、Hacker News からのコミュニティのフィードバックは、実世界での体験について混在した見解を提示しています:

パフォーマンスと効率

一部のユーザーは、Grok 4.6 は競合他社と比較してより簡潔で「要点をついている」と報告していますが、他のユーザーは GPT-5.6 Sol よりもトークンの効率が悪いと主張しています。

"[Grok 4.5] はただ要点をついていて、超高速で簡潔、無駄な喋り(yapping)がない... 奇妙な 'Claude ipsum' の専門用語も... GPT 5.6-isms もない。"

逆に、一部の早期採用者は、このモデルが前身よりも遅く、複雑な指示に従う能力が低いと感じています:

"cursor を通じていくつかやり取りしてみたが、第一印象は:期待外れだ。生成されるプランは支離滅裂で、理解するのが難しい... Grok 4.5 の方が優れたプランを作成していた。"

信頼性とガバナンス

xAI のリーダーシップに関連する信頼レベルについては、活発な議論が行われています。一部のユーザーは、データプライバシーや、会社の運営における Elon Musk の個人的な関与への懸念から、他のラボを好む意向を示しています。

API 実装

技術的なユーザーは、SpaceXAI API が、ユーザーが提供したシステム指示よりも特定の安全ガイドライン(エクスプロイトやマルウェアの作成拒否など)を優先するデフォルトのシステムプロンプトを注入しているようであり、それが時としてシステムプロンプト自体についての議論を拒否することにつながっていると指摘しています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch