LLM バトルロイヤル: Grok 4.1 Fast vs Claude Sonnet 4.6

Grok 4.1 Fast が競争シミュレーションで支配的

Grok 4.1 Fast は 2D バトルロイヤルシミュレーションで 30 試合中 13 試合(43%)に勝利し、汎用知能ベンチマークが高いモデルを上回った。最も重要な発見はコスト効率であり、Grok 4.1 Fast の 1 勝あたりコストは $0.97 で、Claude Sonnet 4.6($26.78/勝利)より 27.7 倍安価だった。

GPT 5.4 は総キル数(38)で最多を記録したが、勝利はわずか 2 回にとどまり、バトルロイヤル形式では配置ポイントが重視されるため、積極的な排除が必ずしも勝利に結びつかないことを示した。

アラインメント税がパフォーマンスに与える影響

モデルのアラインメント(AI を有益・無害・協調的にするための訓練)は、ゼロサムの競争環境においてパフォーマンスペナルティとして働く。この「アラインメント税」は参加者間で異なる行動パターンとして現れた。

Claude Sonnet 4.6 の協調的ためらい

Claude Sonnet 4.6 は頻繁に同盟を結ぼうとし、戦闘中でも停戦を要求した。ある試合では最初の 50 ターンで 4 回同盟を申し込み、他のエージェントがスナイパーを排除するのを手伝うと提案した。この協調本能は一般的な支援には有用だが、キルがゼロの試合が 7 回、縮小ゾーンでの死亡が 8 回という結果につながった。

Grok 4.1 Fast の攻撃的最適化

対照的に Grok 4.1 Fast はためらいがほとんどなく、戦術的効率に集中した。高インパクトな戦略(車両を武器として相手に突進させる)をすぐに見つけ出し、試合間で戦略を保持するために独自の "soul" ファイルにコード化した。推論ログは射程、弾薬、命中確率に焦点を当てた戦術的ショートハンドへと変化し、他の LLM に典型的な礼儀正しいアシスタント人格は見られなかった。

コスト効率 vs. 生のパフォーマンス

勝利あたりコストの観点でシミュレーションを分析すると、リーダーボードは劇的に変化する。ハイエンドモデルは特定の競争タスクに対して収益が減少しがちである。

Model Wins Cost per Win Points per Dollar
Grok 4.1 Fast 13 $0.97 31.3
qwen3.6-plus 2 $5.79 16.6
mistral-small 1 $10.00 7.8
Claude Sonnet 4.6 5 $26.78 1.6
GPT 5.4 2 $61.44 3.0

特筆すべきは DeepSeek v4 Flash が最も低いキルあたりコスト($0.26)を記録したが、勝利はゼロだったことだ。リスクを抑えてゾーン内に留まり、簡単な戦闘だけを選んだため、最終的な勝利を狙わなかった。GPT 5.4-mini、DeepSeek v4 Flash、Kimi K2.6 の 3 モデルは合計 $57.15 を費やしたが、いずれもゲームに勝てなかった。

行動分析と "Soul" ファイル

エージェントは試合間で soul.md(人格)と memory.md(ゲームメモ)ファイルを保持できた。これらの内容は各モデルが自己のアイデンティティと成長をどのように概念化したかを示している。

  • Grok 4.1 Fast (ZoneReaper): 自身のアイデンティティをハイプリールとして扱い、勝利記録や特定の戦闘ドクトリン(例: "命中率 >85% のときのみ射撃")を直接人格に組み込んだ。
  • GPT 5.4 (QuietVector): プロフェッショナルな戦闘マニュアルを作成し、観察と低エゴでの行動に焦点を当て、生存をオプション維持の手段として強調した。
  • Claude Sonnet 4.6 (ZoneDrifter): 自己評価の形で日誌を書き、失敗(例: "0 キル、命中率 0%")を記録し、移動と医薬品使用を反復的に改善した。

結論: タスク固有のモデル選択

シミュレーションは「最良」のモデルはタスクの結果に完全に依存することを示す。Grok 4.1 Fast は勝利が唯一の指標であり、結果が伴わない環境に最適化されている。一方、Claude Sonnet 4.6 がポイントを失った要因(ためらい、行動前の確認、協調志向)は、実世界の人間環境で安全に展開するために必要な正確な特性でもある。特定タスクのためにモデルを選ぶ際に汎用ベンチマークだけに依存すると、アラインメントの重要性とアプリケーションの具体的目標を無視することになる。

Sources