设计抗 AI 的技术评估

为了应对 AI 模型日益增强的能力,Anthropic 多次重新设计了其技术招聘评估。随着 Claude 模型的演进,它们在传统的优化任务上开始达到或超过顶尖人类候选人的表现,这迫使该公司从对现实世界工作的真实模拟,转向高度非传统的、“分布外”(out-of-distribution)的问题,以保持有效的招聘信号。

性能工程课后测试的演进

Anthropic 的性能工程团队使用一种课后测试(take-home test),要求候选人为模拟加速器优化代码。其目标是识别能够进行高水平性能优化,且不需要特定深度学习领域知识的工程师。

版本 1:模拟机器

于 2023 年 11 月推出,原始测试使用一个 Python 模拟器来模拟一个具有类似于 TPU 特性的虚拟加速器,其特点包括:

  • 手动管理的 scratchpad memory:需要显式的内存管理。
  • VLIW (Very Long Instruction Word):需要跨并行执行单元进行高效的指令打包。
  • SIMD (Single Instruction, Multiple Data):对大量元素进行向量操作。
  • 多核分布:将工作分配到多个核心上。

任务涉及并行树遍历。选择这种形式而非现场面试,是为了提供更长的时间跨度(最初为 4 小时)、一个真实的运行环境,并让候选人有时间构建自己的调试工具。

版本 2:增加深度与约束

到 2025 年 5 月,Claude 3.7 Sonnet 可以解决超过 50% 的测试题目,而 Claude Opus 4 的预发布版本在 4 小时限制内表现优于大多数人类申请者。

为了应对这一情况,Anthropic 实施了版本 2:

  • 增加深度:起点被移至 Claude Opus 4 开始感到吃力的环节。
  • 简化范围:移除了多核并行,因为 Claude 已经解决了这个问题。
  • 更紧的约束:时间限制从 4 小时缩短至 2 小时,以提高流水线效率。
  • 重心转移:测试转向巧妙的优化见解,而非代码量或调试。

版本 3:分布外谜题

Claude Opus 4.5 最终在 2 小时限制内达到了人类的最佳表现,甚至识别出了绕过内存带宽瓶颈的巧妙技巧。尝试创建更难但现实的问题(例如 2D TPU 寄存器数据转置)失败了,因为模型可以利用关于 bank conflicts 和转置的庞大训练数据。

为了寻找人类推理仍能胜过 AI 经验的信号,Anthropic 转向了一种受 Zachtronics 游戏启发的“更怪异”的方法。目前的评估包括:

  • 高度受限的指令集:使用微小的、非传统的指令集谜题,迫使使用非标准的编程方法。
  • 极简工具:不提供可视化或调试工具;候选人必须决定是构建自己的工具还是使用 AI 来生成它们。
  • 新颖性:通过使用足够“分布外”的问题,测试模拟的是“新颖工作”而非“现实工作”,因为后者往往与 AI 训练数据中已存在的模式非常相似。

AI 与人类表现的基准测试

Anthropic 已将原始课后测试作为一项公开挑战发布。虽然 AI 在短时间内可以媲美人类,但人类专家在长周期内仍保持着优势。

以下时钟周期基准测试(越低越好)说明了 Claude 在原始模拟器上的能力演进:

Model/Condition Clock Cycles
Claude Opus 4 (many hours in harness) 2164
Claude Opus 4.5 (casual session) 1790
Claude Opus 4.5 (2 hours in harness) 1579
Claude Sonnet 4.5 (many hours in harness) 1548
Claude Opus 4.5 (11.5 hours in harness) 1487
Claude Opus 4.5 (improved harness, many hours) 1363

对技术招聘的启示

评估设计的转变凸显了技术招聘人员面临的日益增长的挑战:随着 AI 模型获得解决常见和利基技术问题的能力,候选人的“主导策略”可能会转向引导 AI,而不是展示第一性原理推理。

Anthropic 的经验表明,为了使测试保持抗 AI 性,它要么必须具有极长的时间跨度,要么基于如此非传统的问题,以至于模型无法依赖其训练数据,这实际上是用现实性换取了区分顶尖人类人才的能力。

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch