xAI Grok 4.1 リリースノート

xAIは、感情インテリジェンス、クリエイティブ・ライティング能力の向上、および事実に基づいたハルシネーション(幻覚)の削減を通じて、実世界での使いやすさを改善したGrok 4.1をリリースしました。このモデルは現在、grok.com、および関連するiOSとAndroidアプリケーションのすべてのユーザーが利用可能です。

最先端の汎用能力

Grok 4.1は、ブラインド・ヒューマン・プリファレンス(人間の好みの盲検評価)において、特にLMArena Text Leaderboardで新たなベンチマークを確立しました。このモデルには、主に2つの構成があります:

  • Grok 4.1 Thinking (code name: quasarflux): この推論モデルは、Eloレーティング1483で総合1位を獲得しており、xAI以外の最高ランクのモデルを31ポイント差でリードしています。
  • Grok 4.1 Non-Reasoning (code name: tensor): このバージョンは、即時的な応答のために思考トークンを使用せず、Eloレーティング1465で総合2位にランクされています。特筆すべきは、Grok 4.1の非推論バージョンが、公開リーダーボード上の他のすべてのモデルのフル推論構成を上回っている点です。

2025年11月1日から11月14日までのサイレント・ロールアウト期間中に実施されたブラインド・ペアワイズ評価において、Grok 4.1は以前のプロダクション・モデルと比較して64.78%の割合で好まれられました。

技術的な最適化と手法

xAIは、Grok 4のスタイル、パーソナリティ、有用性、およびアライメントを最適化するために、Grok 4を支えたものと同じ大規模な強化学習(RL)インフラストラクチャを利用しました。検証不可能な報酬信号を扱うために、xAIは、フロンティア・エージェンティック・リーズニング・モデルを報酬モデルとして使用し、大規模に回答を自律的に評価・反復させる新しい手法を開発しました。

感情インテリジェンスとクリエイティブ・ライティング

Grok 4.1は、対人能力とクリエイティブな出力を測定するために、EQ-Bench3およびCreative Writing v3ベンチマークを使用して評価されました:

  • EQ-Bench3: このLLM判定テストは、45のロールプレイ・シナリオを通じて、能動的な感情インテリジェンス、共感力、および対人スキルを評価します。評価は、デフォルトのサンプリング・パラメータと、規定の判定役としてのClaude Sonnet 3.7を使用して実施されました。
  • Creative Writing v3: このベンチマークは、ルーブリックとモデル・バトルによる正規化されたEloを使用し、3回の反復にわたる32の異なるライティング・プロンプトのパフォーマンスを測定します。

事実に基づいたハルシネーションの削減

xAIは、Grok 4.1のポストトレーニングにおいて、情報探索プロンプトに対する事実に基づいたハルシネーションの削減に焦点を当てました。これは、特に検索ツールを使用するものの、推論の深さが限られている可能性がある高速な非推論モデルを対象としています。

評価は、プロダクション・トラフィックからの実世界の情報探索クエリと、FActScore公開ベンチマーク(伝記に関する500の質問)の層化抽出サンプルを用いて実施されました。ハルシネーション率は、モデルの回答における、重大または軽微な誤りを含むアトミックな主張の割合の、マクロ平均として定義されます。これらの評価は、ウェブ検索ツールを備えた非推論モデルを使用して実施されました。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch