Grok 3 Beta リリースノート / 新機能

xAIは、広範な事前学習知識と高度な推論能力を統合したモデルファミリーであるGrok 3 Betaを導入しました。Colossusスーパークラスターを使用して、従来の最先端モデルの10倍の計算量で学習されたGrok 3は、数学、コーディング、世界知識、および指示に従うタスクにおいて大幅な改善を示しています。

Advanced Reasoning via Test-Time Compute

Grok 3は、大規模な強化学習(RL)を利用して思考プロセス(chain-of-thought)を洗練させる、特化型推論モデルであるGrok 3 (Think)およびGrok 3 mini (Think)を導入しています。これらのモデルは、テスト時計算量(test-time compute)を利用することができ、最終的な回答を出す前に、バックトラック、エラーの修正、および複数の問題解決戦略の探索に、数秒から数分を費やすことができます。

推論モデルのパフォーマンス・ベンチマークは以下の通りです:

  • AIME 2025: Grok 3 (Think)は、最高レベルのテスト時計算量(cons@64)を使用して93.3%を達成しました。
  • GPQA (Graduate-level expert reasoning): Grok 3 (Think)は84.6%に達しました。
  • LiveCodeBench: Grok 3 (Think)は、コード生成および問題解決において79.4%を達成しました。
  • AIME 2024: Grok 3 miniは95.8%に達しました。
  • LiveCodeBench: Grok 3 miniはSTEMタスクにおいて80.4%に達しました。

ユーザーは「Think」ボタンを介してこれらの機能にアクセスでき、モデルの内部推論プロセスを検査することで、完全な透明性を提供します。

Pretraining and General Performance

推論が無効な場合、Grok 3は高品質で即時のレスポンスを提供し、非推論モデルの中で最先端の結果を達成しています。100万トークンのコンテキストウィンドウを備えており、これは従来のxAIモデルの8倍の大きさであり、広範なドキュメントの処理能力と指示への追従精度の向上を実現しています。

主要なベンチマークにおける比較パフォーマンス(Grok 3 Beta vs. 競合他社):

Benchmark Grok 3 Beta Gemini 2.0 DeepSeek-V3 GPT 4o Claude 3.5 Sonnet
AIME’24 52.2% 39.2% 9.3% 16.0%
GPQA 75.4% 64.7% 59.1% 53.6% 65.0%
LCB 57.0% 36.0% 33.1% 32.3% 40.2%
MMLU-pro 79.9% 79.1% 75.9% 72.6% 78.0%
LOFT (128k) 83.3% 75.6% 78.0% 69.9%
MMMU 73.2% 72.7% 69.1% 70.4%
EgoSchema 74.5% 71.9% 72.2%

モデルの初期バージョンであるコードネーム chocolate は、以前にEloスコア1402でLMArena Chatbot Arenaのリーダーボードでトップに立ちました。

Grok Agents and DeepSearch

モデルの能力を現実世界のインタラクションへと拡張するため、xAIは、インターネットアクセスやコードインタープリターを含むツール利用を組み合わせたGrok Agentsを導入しています。

最初のエージェントである DeepSearch は、人類の知識の全コーパスから情報を統合し、矛盾する事実を推論し、包括的なレポートを生成するように設計されています。これは、リアルタイムのニュース合成から詳細な科学的研究まで、幅広いユースケースを想定しています。

Availability and Roadmap

  • User Access: Grok 3は、XおよびGrok.comのPremiumおよびPremium+ユーザーが利用可能です。Premium+ユーザーは、ThinkおよびDeepSearchに、より高い使用制限で即座にアクセスできます。
  • API Access: Grok 3およびGrok 3 mini(標準版および推論版の両方を含む)は、今後数週間以内にAPIプラットフォームを通じてリリースされます。DeepSearchは、エンタープライズパートナー向けにAPI経由で利用可能です。
  • Future Development: 学習は継続中です。エンタープライズAPIへの今後のアップデートには、ツール利用、コード実行、および高度なエージェント機能が含まれ、スケーラブルな監視(scalable oversight)と敵対的堅牢性(adversarial robustness)に焦点を当てます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch