Pac-Bench: LLMのワンショットゲーム開発能力を評価する

Pac-Benchはワンショットゲーム実装における顕著な性能差を明らかにする

Pac-Benchは、最先端の大型言語モデル(LLM)が1ショットで完全に機能するアーケード準拠のPac-Manクローンを生成できるかをテストするためのベンチマークである。結果は、ほぼ完璧な再現から完全な構文エラーまで、広範な能力の差を示している。

Claude Opus 5.5がトップパフォーマーとして浮上し、99/100のスコアを記録。続いてClaude Fable 5.1(96/100)とClaude Sonnet 5.5(95/100)が続いた。一方、Minimax-m3やMuse-Glimmer-30bのようなモデルは著しく失敗し、それぞれ2/100と4/100のスコアにとどまった。

モデルごとのパフォーマンス分解

リーダー層:高忠実度の再現

90点以上のモデルは、アーケード準拠のゴーストAI、衝突検出、複雑なオーディオシステムを含むコアメカニクスを成功裏に実装した。

  • Claude Opus 5.5 (99/100): ほぼ完璧なスコア。ベースラインの音楽付きの2フェーズのインロード、進行に応じて高まる連続サイレン、アーケード風の死亡音を実装した。
  • Claude Fable 5.1 (96/100): 非常に正確だったが、パワーパレット専用の音声がなく、インロードに汎用的なアーペジオを使用した。
  • Claude Sonnet 5.5 (95/100): 矢印キー、WASD、スワイプなど幅広い操作を実装したが、スムーズなサイレンスイープではなく、別々のビープ音で「薄い」音質を生み出した。
  • Grok-4.7 (94/100): マップとゴーストAIを成功裏に実装したが、タイトル画面での矢印キー入力が無視されるなど、特定の操作インタラクションに失敗した。

ミドル層:動作可能だが欠陥あり

60〜90点のモデルは、プレイ可能ではあるが、明らかなメカニカルまたは視覚的なバグを含んでいた。

  • GPT-5.6-sol (90/100): サイレンとミュート機能が欠けており、操作はタイルの中心でのみ動作した。
  • GLM-5.3-flash (88/100): 19x21の小さなマップを作成し、Safariでのオーディオブロッキングの可能性があった。
  • GPT-6-astra (87/100): 復活したゴーストが同じパワーアップサイクル中に再び食べられてしまうバグがあった。
  • DeepSeek-v4.1-flash (72/100): ゴーストAIが完全に失敗しており、怯えたゴーストがPac-Manを追い続ける状態だった。

ロースコア層:非機能的実装

60点未満のモデルは、基本的な空間論理に苦労し、マップに「死胡同」が生じたり、ゴーストがスポーン時に凍結するなど、ゲームとして機能しない状態だった。

  • Claude Opus 5 (58/100): プロットオフセットのバグにより、Pac-Manとゴーストが壁の中に表示された。
  • Gemini-3.7-flash (38/100): Pac-Manが画面外の列を通じてマップを脱出できるゲームを生成した。
  • Grok-4.5 (20/100): 23の死胡同と10個の到達不能なパレットを含むマップを生成し、レベルをクリアできなくなった。
  • Minimax-m3 (2/100): 構文エラーによりキャンバスが空になった。

スコアリング方法論

このベンチマークは以下の5つの主要な技術的基準に基づいてモデルを評価する:

  1. コントロール (20点): キーボード、スワイプ、クリックなどの入力方法とポーズ機能のサポート。
  2. ゴースト (25点): ゴーストAIパターンの正確さと「目」の戻りアニメーション。
  3. Pac-Manの移動 (20点): キャラクターが壁に詰まることがないよう確保。
  4. マップの整合性 (20点): 死胡同や到達不能なパレットの不存在。
  5. 音声 (15点): イントロジングル、サイレン、死亡音の実装。

コミュニティの分析と反論

開発者や研究者の間では、トップモデルの高スコアは、訓練データにPac-Manクローンが多数存在するためであり、真の推論能力ではなく、単なるデータの再現に起因している可能性があると指摘されている。

"明らかに、このベンチマーク用に新しいRLAAS/dataset/envが使われているようだ… その影響で、このベンチマークのスコアはすぐに0→1に跳ね上がるだろう。"

他の批判者は、使用されたプロンプトがあまりにも曖昧であり、ベンチマークがモデルの「欠落した文脈を補完する能力」をテストしているのではなく、厳密な技術仕様を遵守する能力を測っているわけではないと主張した。一部の開発者は、ゲームがPac-Manに見えるものの、手動実装が必要なオリジナルアーケードのゴーストパターンの1:1再現が欠けていると指摘した。

"LLMによる実装では多くの詳細が失われる… ゴーストの挙動はオリジナルとは同じではない。自分でゲームを実装していない限り、違いに気づけない。"

最後に、一部のユーザーは、AIが複雑なクローンをワンショットで生成できる能力が、新しい開発者がゲームプログラミングの基礎を学ぶモチベーションを損なう可能性があると懸念した。これは、「自分で考え抜く喜び」を回避してしまうからである。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • プロジェクト
  • Dispatch