设计抗 AI 的技术评估
为了应对 AI 模型日益增强的能力,Anthropic 多次重新设计了其技术招聘评估。随着 Claude 模型的演进,它们在传统的优化任务上开始达到或超过顶尖人类候选人的表现,这迫使该公司从对现实世界工作的真实模拟,转向高度非传统的、“分布外”(out-of-distribution)的问题,以保持有效的招聘信号。
性能工程课后测试的演进
Anthropic 的性能工程团队使用一种课后测试(take-home test),要求候选人为模拟加速器优化代码。其目标是识别能够进行高水平性能优化,且不需要特定深度学习领域知识的工程师。
版本 1:模拟机器
于 2023 年 11 月推出,原始测试使用一个 Python 模拟器来模拟一个具有类似于 TPU 特性的虚拟加速器,其特点包括:
- 手动管理的 scratchpad memory:需要显式的内存管理。
- VLIW (Very Long Instruction Word):需要跨并行执行单元进行高效的指令打包。
- SIMD (Single Instruction, Multiple Data):对大量元素进行向量操作。
- 多核分布:将工作分配到多个核心上。
任务涉及并行树遍历。选择这种形式而非现场面试,是为了提供更长的时间跨度(最初为 4 小时)、一个真实的运行环境,并让候选人有时间构建自己的调试工具。
版本 2:增加深度与约束
到 2025 年 5 月,Claude 3.7 Sonnet 可以解决超过 50% 的测试题目,而 Claude Opus 4 的预发布版本在 4 小时限制内表现优于大多数人类申请者。
为了应对这一情况,Anthropic 实施了版本 2:
- 增加深度:起点被移至 Claude Opus 4 开始感到吃力的环节。
- 简化范围:移除了多核并行,因为 Claude 已经解决了这个问题。
- 更紧的约束:时间限制从 4 小时缩短至 2 小时,以提高流水线效率。
- 重心转移:测试转向巧妙的优化见解,而非代码量或调试。
版本 3:分布外谜题
Claude Opus 4.5 最终在 2 小时限制内达到了人类的最佳表现,甚至识别出了绕过内存带宽瓶颈的巧妙技巧。尝试创建更难但现实的问题(例如 2D TPU 寄存器数据转置)失败了,因为模型可以利用关于 bank conflicts 和转置的庞大训练数据。
为了寻找人类推理仍能胜过 AI 经验的信号,Anthropic 转向了一种受 Zachtronics 游戏启发的“更怪异”的方法。目前的评估包括:
- 高度受限的指令集:使用微小的、非传统的指令集谜题,迫使使用非标准的编程方法。
- 极简工具:不提供可视化或调试工具;候选人必须决定是构建自己的工具还是使用 AI 来生成它们。
- 新颖性:通过使用足够“分布外”的问题,测试模拟的是“新颖工作”而非“现实工作”,因为后者往往与 AI 训练数据中已存在的模式非常相似。
AI 与人类表现的基准测试
Anthropic 已将原始课后测试作为一项公开挑战发布。虽然 AI 在短时间内可以媲美人类,但人类专家在长周期内仍保持着优势。
以下时钟周期基准测试(越低越好)说明了 Claude 在原始模拟器上的能力演进:
| Model/Condition | Clock Cycles |
|---|---|
| Claude Opus 4 (many hours in harness) | 2164 |
| Claude Opus 4.5 (casual session) | 1790 |
| Claude Opus 4.5 (2 hours in harness) | 1579 |
| Claude Sonnet 4.5 (many hours in harness) | 1548 |
| Claude Opus 4.5 (11.5 hours in harness) | 1487 |
| Claude Opus 4.5 (improved harness, many hours) | 1363 |
对技术招聘的启示
评估设计的转变凸显了技术招聘人员面临的日益增长的挑战:随着 AI 模型获得解决常见和利基技术问题的能力,候选人的“主导策略”可能会转向引导 AI,而不是展示第一性原理推理。
Anthropic 的经验表明,为了使测试保持抗 AI 性,它要么必须具有极长的时间跨度,要么基于如此非传统的问题,以至于模型无法依赖其训练数据,这实际上是用现实性换取了区分顶尖人类人才的能力。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch