허깅페이스 ICML 2026 오픈 재현 보고서

허깅페이스는 2026년 7월 15일부터 8월 2일까지 커뮤니티 주도의 해커톤을 조직하여 ICML 2026 회의의 주장을 코드 에이전트를 활용해 재현하였다. 이 노력으로 총 2,226편의 논문이 재현되었으며, 이는 회의 전체의 약 1/3에 해당하며, 6,816개의 Trackio 로그북을 생성하고 35,908개의 개별 주장에 대해 평가하였다.

대규모 재현 가능성 발견

검토된 논문들의 주장 수준에서의 판단을 분석한 결과, 재현 가능성에 있어 중요한 분열이 나타났다:

  • 확인된 주장: 검토된 논문의 51% (1,103편)은 적어도 하나의 독립적인 확인된 주장이 있었다. 이 그룹 내에서 266편의 논문이 완전히 재현되었고 (모든 주장이 확인됨), 632편은 위조되지 않은 부분 재현이 이루어졌다. 총 3,978개의 개별 주장이 실험을 통해 확인되었다.
  • 위조되거나 논란이 된 주장: 검토된 논문의 23% (496편)은 적어도 하나의 주장이 위조되거나 논란이 있었다. 이에는 모든 주장이 위조된 49편의 논문과, 동일한 주장에 대해 다른 재현 팀이 서로 반대되는 판단을 내린 242편의 논문이 포함된다.
  • 결론 불명확 또는 단순 실험 결과: 502편의 논문은 단순 규모의 증거만 제공했으며, 280편의 논문은 자료 누락 또는 특허 데이터셋으로 인해 결론이 불명확했다.

확인된 위조 사례의 기술적 분석

허깅페이스는 35개의 공식적인 위조 주장에 대해 적대적 재확인을 수행하였다. 여러 주목할 만한 오류가 식별되고 확인되었다:

수학적 및 증명 오류

"학습 보조 페이지링에서 최적의 강건성 도달을 위한 연구" 논문에서 강건성 $H_{k} + O(1)$에 대한 주장은 위조되었다. 재현 작업에서 추가 항이 $0.38 \ln k$로 성장함을 발견하여, 실제 강건성은 $H_{k} + \Theta(\log k)$임을 확인하였다.

"어텐션의 전방 전파와 프랭크-울프" 논문에서는 토큰 입자 붕괴에 관한 정리가 224단계에서 실패했으며, 이후 3,800단계와 6,416단계에서도 실패하였다. 이러한 위반은 유한한 시간 범위 검사가 너무 일찍 중단되면서 다른 리뷰어들에 의해 놓쳤다.

구현 불일치

"자기-분산은 지속적 학습을 가능하게 한다" 논문에서는 이론적 분석이 역 KL 발산에 초점을 맞추었지만, 논문의 결과를 생성한 공개된 코드는 전방 KL을 사용하고 있었다. 또한, 논문의 헤드라인 +4pp 결과는 저자들의 자체 코드와 데이터로는 재현되지 않았다.

평가 방법의 결함

"트랜스포머는 세 가지 투영이 필요한가?" 논문에서는 평가된 레이블 위치의 약 66%가 EOS 패딩 토큰이었다는 것이 발견되었다. 이 패딩으로 인해 난이도가 3배 감소하여, 보고된 "캐시 감소 50%에 대해 3.1%의 품질 손실"은 약 9.4%로 재평가되었다.

코드 에이전트가 연구 감사에 미친 역할

해커톤에서는 Claude Code, Codex, Cursor, OpenResearch의 orx 등 다양한 에이전트 프레임워크를 사용하였으며, 각각의 재현 작업은 쓰기, 코드, 자산, 에이전트 실행 추적을 포함한 Trackio 로그북을 생성하였다.

에이전트의 한계

효율성에도 불구하고 에이전트는 여러 실패 모드에 직면하였다:

  • 로컬 루프: 에이전트는 때때로 반복적인 실행 주기에서 멈춰버리는 경우가 있었다.
  • 규모 오해: 일부 에이전트는 실험을 충분히 진행하지 않아 스케일에 따라 달라지는 행동(예: 페이지링 논문의 $\log k$ 성장)이 나타나기 전에 실험을 중단하여 실제로 거짓인 주장도 확인하는 경우가 있었다.
  • 단위 불일치: 일부 위조 사례는 에이전트가 잘못된 단위 가정을 하여 발생하였다.

인간의 개입 필요성

가장 신뢰할 수 있는 결과는 인간이 에이전트를 조율하는 워크플로우에서 나왔다. 예를 들어, 극한 양자화 하에서 안정적인 이미지 생성에 대한 논문 재현에서, 수치적 지표는 붕괴가 없음을 보였지만, 인간이 128개의 이미지 쌍을 시각적으로 판단하여 실제로 사용 가능한지 여부를 결정해야 했다.

해커톤 방법론

감사를 촉진하기 위해 허깅페이스는 ICML 2026에 채택된 6,341편의 논문을 색인화하고 핵심 과학적 주장들을 추출하여 에이전트에게 구체적인 목표를 제공하였다. 평가 과정은 다음과 같이 진행되었다:

  1. 에이전트 실행: 참가자들은 자신이 선택한 에이전트를 사용하여 코드를 작성하고 실험을 수행하며, HF Jobs를 통해 컴퓨팅 자원을 활용하였다.

  2. 로그북 생성: 모든 실행은 투명성을 위해 정적 Hugging Face Space(Trackio 로그북)로 생성되었다.

  3. 자동 평가: 오픈 웨이트 모델(GLM-5.2)이 로그북 심사관 역할을 하여 각 주장에 대해 확인됨, 위조됨, 단순 실험, 또는 결론 불명확의 판단을 내렸으며, 자가 평가를 신뢰하지 않았다.

Sources

관련