AI耐性のある技術評価の設計

Anthropicは、AIモデルの能力向上に対抗するため、技術採用の評価方法を何度も再設計してきました。Claudeモデルが進化するにつれ、従来の最適化タスクにおいてトップクラスの人間候補者のパフォーマンスに匹敵、あるいはそれを上回るようになり、採用のための有効なシグナルを維持するために、同社は現実的な実務のシミュレーションから、非常に型破りで「分布外(out-of-distribution)」な問題へと移行することを余儀なくされました。

パフォーマンス・エンジニアリング・テイクホーム・テストの進化

Anthropicのパフォーマンス・エンジニアリング・チームは、候補者がシミュレートされたアクセラレータ向けにコードを最適化するテイクホーム・テストを利用しています。その目的は、ディープラーニングに関する特定のドメイン知識を必要とせずに、高度なパフォーマンス最適化が可能なエンジニアを特定することです。

バージョン1:シミュレートされたマシン

2023年11月に開始されたオリジナルのテストは、TPUに似た特性を持つ架空のアクセラレータ用のPythonシミュレータを使用しており、以下の特徴がありました:

  • 手動管理のスクラッチパッド・メモリ: 明示的なメモリ管理が必要。
  • VLIW (Very Long Instruction Word): 並列実行ユニット間での効率的な命令パッキングが必要。
  • SIMD (Single Instruction, Multiple Data): 多数の要素に対するベクトル演算。
  • マルチコア分散: 複数のコアに仕事を分散させる。

タスクは並列ツリー探索でした。この形式は、ライブ・インタビューではなく、より長い時間軸(当初は4時間)を確保し、現実的な環境を提供し、候補者が独自のデバッグ・ツールを構築する時間を与えるために選ばれました。

バージョン2:深化と制約の強化

2025年5月までに、Claude 3.7 Sonnetはテストの50%以上を解くことができ、Claude Opus 4のプレリリース版は4時間の制限時間内でほとんどの人間候補者を上回りました。

これに対抗するため、Anthropicはバージョン2を導入しました:

  • 深化の強化: Claude Opus 4が苦戦し始めたポイントへと開始地点をシフト。
  • 簡素化されたスコープ: Claudeがすでに解決済みであったため、マルチコア並列化を削除。
  • より厳格な制約: パイプラインの効率を高めるため、制限時間を4時間から2時間へと短縮。
  • 焦点のシフト: コードの量やデバッグではなく、巧妙な最適化の洞察へとシフト。

バージョン3:分布外のパズル

Claude Opus 4.5は、最終的に2時間の制限時間内で最高の人間候補者のパフォーマンスに匹敵し、メモリ帯域幅のボトルネックを回避するための巧妙なトリックさえも特定しました。より難しく、かつ現実的な問題(例えば2D TPUレジスタのデータ転置など)を作成しようとする試みは、モデルがバンク・コンフリクトや転置に関する膨大なトレーニング・データを利用できるため、失敗に終わりました。

人間の推論がAIの経験に打ち勝つことができるシグナルを見つけるために、AnthropicはZachtronicsのゲームに触発された「より奇妙な」アプローチへと移行しました。現在の評価は以下の構成となっています:

  • 高度に制約された命令セット: 非標準的なプログラミング手法を強制する、極めて小さく型破りな命令セットを使用したパズル。
  • 最小限のツール群: 可視化やデバッグ・ツールは提供されず、候補者は独自のツールを構築するか、AIを使って生成するかを決定しなければなりません。
  • 新規性: 十分に「分布外」な問題を使用することで、テストは「現実的な仕事」ではなく「新規な仕事」をシミュレートします。後者は、AIのトレーニング・データに既に存在するパターンと似ていることが多いためです。

AI対人間のパフォーマンス・ベンチマーク

Anthropicは、オリジナルの・テイクホーム・テストをオープン・チャレンジとして公開しました。AIは短い時間枠では人間に匹敵しますが、長期的な時間軸においては、依然として人間のエキスパートが優位性を保っています。

以下のクロック・サイクル・ベンチマーク(数値が低いほど優れている)は、オリジナルの・シミュレータ上でのClaudeの能力の進展を示しています:

| モデル/条件 | クロック・サイクル数 | | :--- | :--- | | | Claude Opus 4 (many hours in harness) | 2164 | | Claude Opus 4.5 (casual session) | 1790 | | Claude Opus 4.5 (2 hours in harness) | 1579 | | Claude Sonnet 4.5 (1548) | 1548 | | Claude Opus 4.5 (11.5 hours in harness) | 1487 | | Claude Opus 4.5 (improved harness, many hours) | 1363 |

技術採用における示唆

評価設計のシフトは、技術採用担当者にとって増大する課題を浮材にしています。AIモデルが一般的、あるいはニッチな技術的問題を解決する能力を獲得するにつれ、候補者の「支配的な戦略」は、第一原理に基づいた推論を示すことではなく、AIを操る方向へとシフトする可能性があります。

Anthropicの経験は、テストがAI耐性を維持するためには、極端に長い時間軸を持つか、あるいはモデルがトレーニング・データに依存できないほど型破りな問題に基づいている必要があることを示唆しています。これは、実務のリアリズムを、トップ層の人間の才能を識別するための能力と引き換えに、あプローチングしています。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch