AI 저항적 기술 평가 설계하기

Anthropic은 AI 모델의 능력이 향상됨에 따라 기술 채용 평가 방식을 여러 차례 재설계했습니다. Claude 모델이 발전함에 따라 전통적인 최적화 작업에서 상위권 인간 후보자와 대등하거나 그 이상의 성능을 보이기 시작했고, 이에 따라 회사는 채용을 위한 유효한 신호를 유지하기 위해 실제 업무의 현실적인 시뮬레이션에서 매우 이례적인 "out-of-distribution" 문제로 전환해야 했습니다.

성능 엔지니어링 과제(Take-Home)의 진화

Anthropic의 성능 엔지니어링 팀은 후보자가 시뮬레이션된 가속기를 위해 코드를 최적화하는 take-home 테스트를 활용합니다. 목표는 딥러닝에 대한 특정 도메인 지식 없이도 고수준의 성능 최적화가 가능한 엔지니어를 식별하는 것입니다.

버전 1: 시뮬레이션된 머신

2023년 11월에 출시된 초기 테스트는 TPU와 유사한 특성을 가진 가짜 가속기를 위한 Python 시뮬레이터를 사용했으며, 다음과 같은 특징을 가집니다:

  • 수동 관리 스크래치패드 메모리: 명시적인 메모리 관리가 필요함.
  • VLIW (Very Long Instruction Word): 병렬 실행 유닛 간의 효율적인 명령어 패킹이 필요함.
  • SIMD (Single Instruction, Multiple Data): 많은 요소에 대한 벡터 연산.
  • 멀티코어 분산: 여러 코어에 걸쳐 작업 분산.

과제는 병렬 트리 순회(parallel tree traversal)를 포함했습니다. 이 형식은 더 긴 시간 범위(초기 4시간)를 허용하고, 현실적인 환경을 제공하며, 후보자가 자체 디버깅 도구를 구축할 시간을 주기 위해 라이브 인터뷰 대신 선택되었습니다.

버전 2: 깊이와 제약 조건의 강화

2025년 5월경, Claude 3.7 Sonnet은 테스트의 50% 이상을 해결할 수 있게 되었고, Claude Opus 4의 프리릴리스 버전은 4시간 제한 내에서 대부분의 인간 지원자를 능가했습니다.

이에 대응하기 위해 Anthropic은 버전 2를 구현했습니다:

  • 깊이 증가: 시작 지점을 Claude Opus 4가 어려움을 겪기 시작하는 지점으로 이동.
  • 범위 단순화: Claude가 이미 해결했으므로 멀티코어 병렬성을 제거.
  • 더 엄격한 제약 조건: 파이프라인 효율성을 높이기 위해 시간 제한을 4시간에서 2시간으로 단축.
  • 집중 분야: 코드 양이나 디버깅보다는 영리한 최적화 통찰력 쪽으로 테스트 방향을 전환.

버전 3: Out-of-Distribution 퍼즐

Claude Opus 4.5는 결국 2시간 제한 내에서 최고의 인간 성능과 대등해졌으며, 메모리 대역폭 병목 현상을 우회하는 영리한 트릭까지 찾아냈습니다. 더 어렵지만 현실적인 문제(예: 2D TPU 레지스터 데이터 전치)를 만들려는 시도는 모델이 뱅크 충돌(bank conflicts) 및 전치(transposition)에 관한 방대한 학습 데이터를 활용할 수 있기 때문에 실패했습니다.

인간의 추론이 AI의 경험을 여전히 이길 수 있는 신호를 찾기 위해, Anthropic은 Zachtronics 게임에서 영감을 받은 "더 기괴한" 접근 방식으로 전환했습니다. 현재의 평가는 다음과 같이 구성됩니다:

  • 고도로 제약된 명령어 세트: 표준적이지 않은 프로그래밍 방식을 강요하는 작고 이례적인 명령어 세트를 사용하는 퍼즐.
  • 최소한의 도구: 시각화 또는 디버깅 도구가 제공되지 않음; 후보자는 자체적으로 구축할지 아니면 AI를 사용하여 생성할지 결정해야 함.
  • 참신성: 충분히 out-of-distribution인 문제를 사용함으로써, 테스트는 "실제 업무"가 아닌 "새로운 업무"를 시뮬레이션합니다. 실제 업무는 종종 AI 학습 데이터에 이미 존재하는 패턴과 유사하기 때문입니다.

AI vs 인간 성능 벤치마킹

Anthropic은 원래의 take-home 테스트를 오픈 챌린지로 공개했습니다. AI가 짧은 시간 내에는 인간과 대등할 수 있지만, 긴 시간 범위에서는 여전히 인간 전문가가 우위를 점하고 있습니다.

다음 클록 사이클 벤치마크(낮을수록 좋음)는 원래의 시뮬레이터에서 Claude의 능력 발전을 보여줍니다:

모델/조건 클록 사이클
Claude Opus 4 (harness에서 여러 시간 수행) 2164
Claude Opus 4.5 (일반 세션) 1790
Claude Opus 4.5 (harness에서 2시간 수행) 1579
Claude Sonnet 4.5 (harness에서 여러 시간 수행) 1548
Claude Opus 4.5 (harness에서 11.5시간 수행) 1487
Claude Opus 4.5 (개선된 harness, 여러 시간 수행) 1363

기술 채용에 주는 시사점

평가 설계의 변화는 기술 채용 담당자들에게 커지는 과제를 보여줍니다. AI 모델이 일반적이고 특수한 기술 문제를 해결하는 능력을 갖추게 됨에 따라, 후보자의 "지배적인 전략"은 제1원리(first-principles) 추론을 보여주는 것이 아니라 AI를 유도하는 방향으로 바뀔 수 있습니다.

Anthropic의 경험은 테스트가 AI 저항성을 유지하려면, 매우 긴 시간 범위를 가져야 하거나 모델이 학습 데이터에 의존할 수 없을 정도로 매우 이례적인 문제에 기반해야 함을 시사합니다. 이는 사실상 현실성을 희생하여 최상위권 인간 인재를 구별할 수 있는 능력을 얻는 것입니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch