設計抗 AI 技術評估
Anthropic 重新設計了其技術招聘評估多次,以應對 AI 模型日益增強的能力。隨著 Claude 模型不斷演進,它們開始在傳統的優化任務上達到或超過頂尖人類候選人的表現,迫使公司從現實世界的模擬工作轉向高度非常規、"out-of-distribution"(分布外)的問題,以維持有效的招聘信號。
效能工程帶回家測試的演進
Anthropic 的效能工程團隊使用一種帶回家測試,讓候選人為模擬的加速器優化代碼。其目標是識別出能夠進行高層次效能優化,而不需要特定深度學習領域知識的工程師。
版本 1:模擬機器
於 2023 年 11 月推出,原始測試使用一個 Python 模擬器來模擬一個具有類似 TPU 特性的虛擬加速器,其特點包括:
- 手動管理的 scratchpad memory:需要顯式的記憶體管理。
- VLIW (Very Long Instruction Word):需要跨並行執行單元進行高效的指令打包。
- SIMD (Single Instruction, Multiple Data):對許多元素進行向量操作。
- 多核分佈:將工作分佈到多個核心。
該任務涉及並行樹遍歷。選擇這種格式而非現場面試,是為了提供較長的時限(最初為 4 小時),一個現實的環境,以及讓候選人建立自己除錯工具的時間。
版本 2:增加深度與限制
到 2025 年 5 月,Claude 3.7 Sonnet 可以解決超過 50% 的測試,而 Claude Opus 4 的預發布版本在 4 小時限制內超越了大多數人類候選人。
為了應對這一點,Anthropic 實施了版本 2:
- 增加深度:起點被移至 Claude Opus 4 開始感到吃力的位置。
- 簡化範圍:移除了多核並行,因為 Claude 已經解決了它。
- 更嚴格的限制:時間限制從 4 小時減少到 2 小時,以提高流程效率。
- 焦點:測試轉向巧妙的優化洞察,而非代碼量或除錯。
版本 3:分布外謎題
Claude Opus 4.5 最終在 2 小時限制內達到與最佳人類表現相當的水平,甚至能識別出繞過記憶體頻寬瓶頸的巧妙技巧。
為了尋找人類推理能力仍能勝過 AI 經驗的信號,Anthropic 轉向了一種受 Zachtronics 遊戲啟發的「更怪異」的方法。目前的評估由以下組成:
- 高度受限的指令集:使用微小且非常規的指令集謎題,迫使使用非標準的編程方法。
- 極簡工具:不提供視覺化或除錯工具;候選人必須決定是否要建立自己的工具,或使用 AI 來生成它們。
- 新穎性:透過使用足夠的 out-of-distribution(分布外)的問題,測試模擬的是「新穎工作」而非「現實工作」,因為後者往往與 AI 訓練數據中已存在的模式相似。
AI 與人類表現的基準測試
Anthropic 已將原始的帶回家測試作為一項公開挑戰。雖然 AI 在短時間內可以比肩人類,但在長時限內,人類專家仍保有優勢。
以下時鐘週期基準測試(數值越低越好)說明了 Claude 在原始模擬器上的能力演進:
| Model/Condition | Clock Cycles |
|---|---|
| Claude Opus n/a | 2164 |
| Claude Opus 4.5 (casual session) | 1790 |
| Claude Opus 4.5 (2 hours in harness) | 1579 |
| Claude Sonnet 4.n/a | 頂尖人類候選人 |
| Claude Opus 4.5 (11.5 hours in harness) | 1487 |
| Claude Opus 4.5 (improved harness, many hours) | 1363 |
技術招聘的影響
評估設計的轉變突顯了技術招聘人員面臨的日益增長的挑戰:隨著 AI 模型具備了求解常見及利基技術問題的能力,候選選手的「主導策略」可能會轉向從引導 AI 而非展示第一原理推理的能力。
Anthropic 的經驗表明,為了讓測試保持抗 AI 性,測試必須是極長時限的,或者是基於如此非常規的問題,使得模型無法依賴其訓練數據,有效地以現實主義換取區分頂尖人類人才的能力。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch