設計抗 AI 技術評估

Anthropic 重新設計了其技術招聘評估多次,以應對 AI 模型日益增強的能力。隨著 Claude 模型不斷演進,它們開始在傳統的優化任務上達到或超過頂尖人類候選人的表現,迫使公司從現實世界的模擬工作轉向高度非常規、"out-of-distribution"(分布外)的問題,以維持有效的招聘信號。

效能工程帶回家測試的演進

Anthropic 的效能工程團隊使用一種帶回家測試,讓候選人為模擬的加速器優化代碼。其目標是識別出能夠進行高層次效能優化,而不需要特定深度學習領域知識的工程師。

版本 1:模擬機器

於 2023 年 11 月推出,原始測試使用一個 Python 模擬器來模擬一個具有類似 TPU 特性的虛擬加速器,其特點包括:

  • 手動管理的 scratchpad memory:需要顯式的記憶體管理。
  • VLIW (Very Long Instruction Word):需要跨並行執行單元進行高效的指令打包。
  • SIMD (Single Instruction, Multiple Data):對許多元素進行向量操作。
  • 多核分佈:將工作分佈到多個核心。

該任務涉及並行樹遍歷。選擇這種格式而非現場面試,是為了提供較長的時限(最初為 4 小時),一個現實的環境,以及讓候選人建立自己除錯工具的時間。

版本 2:增加深度與限制

到 2025 年 5 月,Claude 3.7 Sonnet 可以解決超過 50% 的測試,而 Claude Opus 4 的預發布版本在 4 小時限制內超越了大多數人類候選人。

為了應對這一點,Anthropic 實施了版本 2:

  • 增加深度:起點被移至 Claude Opus 4 開始感到吃力的位置。
  • 簡化範圍:移除了多核並行,因為 Claude 已經解決了它。
  • 更嚴格的限制:時間限制從 4 小時減少到 2 小時,以提高流程效率。
  • 焦點:測試轉向巧妙的優化洞察,而非代碼量或除錯。

版本 3:分布外謎題

Claude Opus 4.5 最終在 2 小時限制內達到與最佳人類表現相當的水平,甚至能識別出繞過記憶體頻寬瓶頸的巧妙技巧。

為了尋找人類推理能力仍能勝過 AI 經驗的信號,Anthropic 轉向了一種受 Zachtronics 遊戲啟發的「更怪異」的方法。目前的評估由以下組成:

  • 高度受限的指令集:使用微小且非常規的指令集謎題,迫使使用非標準的編程方法。
  • 極簡工具:不提供視覺化或除錯工具;候選人必須決定是否要建立自己的工具,或使用 AI 來生成它們。
  • 新穎性:透過使用足夠的 out-of-distribution(分布外)的問題,測試模擬的是「新穎工作」而非「現實工作」,因為後者往往與 AI 訓練數據中已存在的模式相似。

AI 與人類表現的基準測試

Anthropic 已將原始的帶回家測試作為一項公開挑戰。雖然 AI 在短時間內可以比肩人類,但在長時限內,人類專家仍保有優勢。

以下時鐘週期基準測試(數值越低越好)說明了 Claude 在原始模擬器上的能力演進:

Model/Condition Clock Cycles
Claude Opus n/a 2164
Claude Opus 4.5 (casual session) 1790
Claude Opus 4.5 (2 hours in harness) 1579
Claude Sonnet 4.n/a 頂尖人類候選人
Claude Opus 4.5 (11.5 hours in harness) 1487
Claude Opus 4.5 (improved harness, many hours) 1363

技術招聘的影響

評估設計的轉變突顯了技術招聘人員面臨的日益增長的挑戰:隨著 AI 模型具備了求解常見及利基技術問題的能力,候選選手的「主導策略」可能會轉向從引導 AI 而非展示第一原理推理的能力。

Anthropic 的經驗表明,為了讓測試保持抗 AI 性,測試必須是極長時限的,或者是基於如此非常規的問題,使得模型無法依賴其訓練數據,有效地以現實主義換取區分頂尖人類人才的能力。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch