xAI Grok 4.7 リリースノート

xAI は、複雑なコーディングおよびプロフェッショナルな知識作業に特化して最適化されたモデルである Grok 4.7 をリリースしました。このモデルは、Grok 4.6 の後継者として、より大きなベースモデルと、数時間かかるタスクに焦点を当てたトレーニング体制を採用することで、前バージョンをさらに進化させています。

技術的な改善点とトレーニング

Grok 4.7 は Grok 4.6 よりも大きなベースモデルに基づいており、延長された強化学習の実行を経てトレーニングされています。このトレーニングは、数時間かかる問題に重点を置いたより難しいタスクの混合に特化しており、モデルが自身の作業をより良く検証し、より長いコンテキストを管理できるようにしています。

さらに、xAI は Grok 4.7 が Grok Bot ハーネスをネイティブに理解できるようにトレーニングし、一般的な知識作業および会話タスクにおけるパフォーマンスを向上させました。

パフォーマンスベンチマーク

Grok 4.7 は、いくつかのプロフェッショナルおよび技術的なベンチマークにおいて Grok 4.6 に対して顕著な改善を示しています。特に、長時間実行されるコーディングタスクにおける CursorBench 4.0 において、価格性能比の観点から非常に競争力のある選択肢となっています。

ソフトウェアおよび電気工学

  • CursorBench 4.0: Grok 4.7 は 46.3% を達成、Grok 4.6 の 40.4% を上回りました。
  • DeepSWE v1.1: Grok 4.7 は 71.0%(高負荷)を達成、Grok 4.6 の 65.2% を上回りました。
  • EEBench: Grok 4.7 は 64.0% を記録、Grok 4.6 の 53.0% や GPT-5.6 Sol Max の 39.4% を大きく上回りました。

プロフェッショナルな知識作業

  • AA Briefcase v1.1: Grok 4.7 は 1,657 を記録、Grok 4.6 の 1,546 を上回りました。
  • Harvey Legal Agent Benchmark: Grok 4.7 は 19.6% を記録、Grok 4.6 の 15.8% を大幅に上回り、GPT-5.6 Sol Max の 2.5% や Fable 5.1 Max の 6.7% を大きく上回りました。
  • HealthBench Professional: Grok 4.7 は 56.7% を記録、Grok 4.6 の 48.5% を上回りました。
  • Terminal-Bench 4.0: Grok 4.7 は 38.0% を記録、Grok 4.6 の 20.3% を上回りました。

セキュリティとサイバーセキュリティ

Grok 4.7 はまったく新しいセーフガードスタックを実装しており、破壊的攻撃(jailbreak)に対する耐性と拒否率において、xAI がテストした中で最も強力なモデルとなっています。

バイオセキュリティとサイバー防御

  • バイオセキュリティ: モデルは LatchBio のバイオセキュリティベンチマークで 62.4% を記録し、トップスコアを獲得しました。
  • サイバーセキュリティ: HackerBench v0.3 において、Grok 4.7 はリスクのある二重用途のプロンプトのうちわずか 3.3% しか通過させず、正当なセキュリティ作業に対する拒否率も低く維持しています。

防御研究を支援するために、xAI は特定のサイバーセキュリティパートナーに対して、モデルのレッドチーム機能への招待制アクセスを提供しています。

価格と利用可能範囲

Grok 4.7 は Grok API、Grok Build、Cursor、サードパーティのコーディングハーネス、モデルルーター、クラウドプラットフォームを通じて利用可能です。

価格構造:

  • スタンダード: 入力トークン 100万トークンあたり $2、出力トークン 100万トークンあたり $6。
  • ファストバリアント: スタンダードバリアントの価格の2倍で、出力速度が2倍になります。

Sources