xAI Grok 4 リリースノート
xAI は、スケーラブルな強化学習とネイティブなツール利用を通じて先端知能の限界を押し広げるよう設計された Grok 4 のリリースを発表しました。このモデルは SuperGrok および Premium+ サブスクライバー向けに利用可能であり、また xAI API を通じても利用可能です。
スケーラブルな強化学習とインフラ
Grok 4 の推論能力は、事前学習規模までスケーリングされた強化学習(RL)訓練によって開発されました。この進歩は Colossus 200,000 GPU クラスタおよびインフラ、アルゴリズムの革新により、計算効率を 6 倍向上させることで支えられています。
モデルの汎用性を向上させるために、xAI は数学やコーディングに加えて、複数の追加ドメインにおける検証可能な訓練データを拡張しました。このアプローチにより、前回の訓練実行よりも 10 倍以上多くの計算リソースを活用しながらも、スムーズなパフォーマンス向上が実現されました。
ネイティブなツール利用と X との統合
Grok 4 は強化学習で訓練され、コードインタプリタやウェブブラウジングといったツールをネイティブに利用できるようにしています。モデルは自ら検索クエリを決定し、ウェブ全体から高品質な応答を合成します。
X プラットフォームとの統合はコア機能であり、Grok 4 が高度なキーワード検索や意味検索ツール、メディア分析を活用して X 内からリアルタイム情報を取得できるようにしています。
Grok 4 Heavy と並列テスト時計算
Grok 4 Heavy は並列テスト時計算を活用する特殊なバージョンであり、複数の仮説を同時に検討できるようにしています。このバリアントは信頼性と複雑な推論における新しいパフォーマンス基準を設定しています:
- Humanity's Last Exam: Grok 4 Heavy は、このエキスパートレベルのベンチマークで初めて 50%(テキストのみのサブセットでは 50.7%)のスコアを達成しました。
- 学術ベンチマーク: モデルはほとんどの学術ベンチマークで飽和状態に達しています。
先端知能ベンチマーク
Grok 4 は、閉鎖型モデル向けのいくつかの高難易度ベンチマークで最先端のパフォーマンスを示しています:
- ARC-AGI V2: 15.9% を達成し、Claude Opus の約 8.6% と比べてほぼ 2 倍です。
- Vending-Bench (Agentic): 4,694.15 ドルの純資産と 4,569 単位の販売数を達成し、Claude Opus 4(2,077.41 ドル)や人間(844.05 ドル)を大きく上回りました。
- USAMO'25: Grok 4 Heavy が 61.9 のスコアでリードしています。
API 機能とエンタープライズセキュリティ
Grok 4 API は開発者にマルチモーダル理解と 256,000 トークンのコンテキスト窓を提供します。主な機能は以下の通りです:
- ライブ検索 API: X、ウェブ、ニュースソース across でのリアルタイムデータ検索を統合しています。
- コンプライアンス: API は SOC 2 Type 2、GDPR、CCPA 認定済みです。
- 利用可能時期: モデルはハイパースケーラー提携パートナーを通じてエンタープライズ展開向けに近日中に提供予定です。
マルチモーダル音声と視覚モード
xAI は、より現実的で応答性の高いアップグレード版の音声モードを導入しました。このモードには新しい音声と再設計された会話インターフェースが含まれます。
さらに、Grok 4 はライブの視覚入力を処理できるようになりました。音声チャット中に動画を有効にすると、モデルはユーザーのカメラ映像をリアルタイムで分析し、見ている内容に基づいた洞察を提供できます。この機能は社内開発の強化学習フレームワークと音声圧縮技術を用いて開発されました。
今後のロードマップ
xAI は、制御されたドメインにおける検証可能な報酬を超えて、動的環境における複雑な現実世界の問題を解決する方向へ、強化学習のスケーリングを継続的に進めることを計画しています。今後の開発は、視覚と音声のマルチモーダル統合の改善に注力し、より直感的で効率的な AI システムの構築を目指します。
Sources
- OriginalGrok 4
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch