AI 저항적 기술 평가 설계하기
Anthropic은 AI 모델의 능력이 향상됨에 따라 기술 채용 평가 방식을 여러 차례 재설계했습니다. Claude 모델이 발전함에 따라 전통적인 최적화 작업에서 상위권 인간 후보자와 대등하거나 그 이상의 성능을 보이기 시작했고, 이에 따라 회사는 채용을 위한 유효한 신호를 유지하기 위해 실제 업무의 현실적인 시뮬레이션에서 매우 이례적인 "out-of-distribution" 문제로 전환해야 했습니다.
성능 엔지니어링 과제(Take-Home)의 진화
Anthropic의 성능 엔지니어링 팀은 후보자가 시뮬레이션된 가속기를 위해 코드를 최적화하는 take-home 테스트를 활용합니다. 목표는 딥러닝에 대한 특정 도메인 지식 없이도 고수준의 성능 최적화가 가능한 엔지니어를 식별하는 것입니다.
버전 1: 시뮬레이션된 머신
2023년 11월에 출시된 초기 테스트는 TPU와 유사한 특성을 가진 가짜 가속기를 위한 Python 시뮬레이터를 사용했으며, 다음과 같은 특징을 가집니다:
- 수동 관리 스크래치패드 메모리: 명시적인 메모리 관리가 필요함.
- VLIW (Very Long Instruction Word): 병렬 실행 유닛 간의 효율적인 명령어 패킹이 필요함.
- SIMD (Single Instruction, Multiple Data): 많은 요소에 대한 벡터 연산.
- 멀티코어 분산: 여러 코어에 걸쳐 작업 분산.
과제는 병렬 트리 순회(parallel tree traversal)를 포함했습니다. 이 형식은 더 긴 시간 범위(초기 4시간)를 허용하고, 현실적인 환경을 제공하며, 후보자가 자체 디버깅 도구를 구축할 시간을 주기 위해 라이브 인터뷰 대신 선택되었습니다.
버전 2: 깊이와 제약 조건의 강화
2025년 5월경, Claude 3.7 Sonnet은 테스트의 50% 이상을 해결할 수 있게 되었고, Claude Opus 4의 프리릴리스 버전은 4시간 제한 내에서 대부분의 인간 지원자를 능가했습니다.
이에 대응하기 위해 Anthropic은 버전 2를 구현했습니다:
- 깊이 증가: 시작 지점을 Claude Opus 4가 어려움을 겪기 시작하는 지점으로 이동.
- 범위 단순화: Claude가 이미 해결했으므로 멀티코어 병렬성을 제거.
- 더 엄격한 제약 조건: 파이프라인 효율성을 높이기 위해 시간 제한을 4시간에서 2시간으로 단축.
- 집중 분야: 코드 양이나 디버깅보다는 영리한 최적화 통찰력 쪽으로 테스트 방향을 전환.
버전 3: Out-of-Distribution 퍼즐
Claude Opus 4.5는 결국 2시간 제한 내에서 최고의 인간 성능과 대등해졌으며, 메모리 대역폭 병목 현상을 우회하는 영리한 트릭까지 찾아냈습니다. 더 어렵지만 현실적인 문제(예: 2D TPU 레지스터 데이터 전치)를 만들려는 시도는 모델이 뱅크 충돌(bank conflicts) 및 전치(transposition)에 관한 방대한 학습 데이터를 활용할 수 있기 때문에 실패했습니다.
인간의 추론이 AI의 경험을 여전히 이길 수 있는 신호를 찾기 위해, Anthropic은 Zachtronics 게임에서 영감을 받은 "더 기괴한" 접근 방식으로 전환했습니다. 현재의 평가는 다음과 같이 구성됩니다:
- 고도로 제약된 명령어 세트: 표준적이지 않은 프로그래밍 방식을 강요하는 작고 이례적인 명령어 세트를 사용하는 퍼즐.
- 최소한의 도구: 시각화 또는 디버깅 도구가 제공되지 않음; 후보자는 자체적으로 구축할지 아니면 AI를 사용하여 생성할지 결정해야 함.
- 참신성: 충분히 out-of-distribution인 문제를 사용함으로써, 테스트는 "실제 업무"가 아닌 "새로운 업무"를 시뮬레이션합니다. 실제 업무는 종종 AI 학습 데이터에 이미 존재하는 패턴과 유사하기 때문입니다.
AI vs 인간 성능 벤치마킹
Anthropic은 원래의 take-home 테스트를 오픈 챌린지로 공개했습니다. AI가 짧은 시간 내에는 인간과 대등할 수 있지만, 긴 시간 범위에서는 여전히 인간 전문가가 우위를 점하고 있습니다.
다음 클록 사이클 벤치마크(낮을수록 좋음)는 원래의 시뮬레이터에서 Claude의 능력 발전을 보여줍니다:
| 모델/조건 | 클록 사이클 |
|---|---|
| Claude Opus 4 (harness에서 여러 시간 수행) | 2164 |
| Claude Opus 4.5 (일반 세션) | 1790 |
| Claude Opus 4.5 (harness에서 2시간 수행) | 1579 |
| Claude Sonnet 4.5 (harness에서 여러 시간 수행) | 1548 |
| Claude Opus 4.5 (harness에서 11.5시간 수행) | 1487 |
| Claude Opus 4.5 (개선된 harness, 여러 시간 수행) | 1363 |
기술 채용에 주는 시사점
평가 설계의 변화는 기술 채용 담당자들에게 커지는 과제를 보여줍니다. AI 모델이 일반적이고 특수한 기술 문제를 해결하는 능력을 갖추게 됨에 따라, 후보자의 "지배적인 전략"은 제1원리(first-principles) 추론을 보여주는 것이 아니라 AI를 유도하는 방향으로 바뀔 수 있습니다.
Anthropic의 경험은 테스트가 AI 저항성을 유지하려면, 매우 긴 시간 범위를 가져야 하거나 모델이 학습 데이터에 의존할 수 없을 정도로 매우 이례적인 문제에 기반해야 함을 시사합니다. 이는 사실상 현실성을 희생하여 최상위권 인간 인재를 구별할 수 있는 능력을 얻는 것입니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch