Hugging Face ICML 2026 Open Reproductions Report
Hugging Faceは、2026年7月15日から8月2日まで、コーディングエージェントを活用してICML 2026カンファレンスの主張を再現する、コミュニティ主導のハッカソンを開催しました。この取り組みにより、カンファレンスの約3分の1にあたる2,226件の論文が再現され、6,816件のTrackioログブックが生成され、35,908件の個別の主張が検証されました。
Large-Scale Reproducibility Findings
検証された論文全体における主張レベルの判定結果を分析したところ、再現性に関して顕著な分かれ目があることが明らかになりました。
- Verified Claims: 検証された論文の51%(1,103件)において、少なくとも1つの独立して検証された主張がありました。このグループ内では、266件の論文が完全に再現され(すべての主張が検証済み)、632件は偽造が確認されず部分的に再現されました。合計で3,978件の個別の主張が実験を通じて確認されました。
- Falsified or Contested Claims: 検証された論文の23%(496件)において、少なくとも1つの主張が偽造または異議が唱えられたものがありました。これには、すべての主張が偽造された49件の論文と、異なる再現チームが同じ主張に対して相反する判定を下した242件の論文が含まれます。
- Inconclusive or Toy Results: 502件の論文はトイ・スケールのエビデンスのみを提供しており、280件の論文は、アーティファクトの欠如や独自のデータセットによる理由で、結論が出せない状態のままでした。
Technical Analysis of Confirmed Falsifications
Hugging Faceは、35件の正式な偽造主張を敵対的に再検証しました。いくつかの注目すべきエラーが特定され、確認されました。
Mathematical and Proof Errors
「Towards Optimal Robustness in Learning-Augmented Paging」という論文において、堅牢性 $H_{k} + O(1)$ という主張が偽造であることが判明しました。再現の試みにより、加法項は $0.38 ext{ln } k$ として成長することが判明し、真の堅牢性は $H_{k} + ext{Θ}( ext{log } k)$ であることが分かりました。
「Attention's forward pass and Frank-Wolfe」では、トークン粒子崩壊に関する定理が、ステップ224(およびその後3,800および6,416ステップ)で失敗することが判明しました。これらの違反は、有限ホライゾン・チェックが早すぎる段階で停止したため、他の査読者に見落とされていました。
Implementation Discrepancies
「Self-Distillation Enables Continual Learning」では、理論的分析は逆KLダイバージェンスに焦点を当てていましたが、公開されたコード(論文の結果を生成したもの)は順方向KLを使用していました。さらに、論文のヘッドラインにある +4pp の結果は、著者自身のコードとデータを使用して再現することができませんでした。
Evaluation Flaws
「Do Transformers Need Three Projections?」では、評価されたラベル位置の約66%がEOS padding tokensであったことが判明しました。このパディングはパープレキシティを3倍に低下させ、報告された「50%キャッシュ削減のための3.1%の品質コスト」を約9.4%に変更しました。
The Role of Coding Agents in Research Audit
このハッカソンでは、Claude Code、Codex、Cursor、および OpenResearchの orx を含む、さまざまなエージェント・フレームワークを活用しました。各再現は、記述、コード、アーティファクト、およびエージェントの実行トレースを含む Trackio ログブックを生成しました。
Agent Limitations
効率的ではあるものの、エージェントはいくつかの失敗モードに直面しました。
- Local Loops: エージェントは、時折、繰り返しの実行サイクルに陥ることがありました。
- Scale Misinterpretation: 一部のエージェントは、スケール依存の挙動(paging論文における $ ext{log } k$ の成長など)が明らかになる前に実験を停止したため、実際には誤っている主張を検証済みと判定しました。
- Unit Mismatches: 一部の偽造は、エージェントによる不正確な単位の仮定に基づいていました。
Human-in-the-Loop Necessity
最も信頼性の高い結果は、人間がエージェントを誘導するワークフローから得きました。例えば、極端な量子化条件下での安定した画像生成に関する論文の再現において、数値的指標は崩壊を示していませんでしたが、人間が128組の画像ペアを視覚的に判断することで、初めて、画像が実際に使用可能かどうかを判断することができました。
Hackathon Methodology
監査を促進するため、Hugging Faceは、採択された ICML 2026 論文 6,341件をインデックス化し、コアとなる科学的主張を抽出して、エージェントに具体的なターゲットを提供しました。
Agent Execution: 参加者は、選択したエージェントを使用して、コードを書き、HF Jobs を用いて計算リソースを計算を実行しました。
Logbook Generation: 透明性のために、すべての実行は静的な Hugging Face Space (Trackio ログブック) を生成しました。
Automated Judging: オープンウェイト・モデル (GLM-5.2) が Logbook Judge として機能し、各主張に対して verified, falsified, toy, または inconclusive の判定を下し、自己評価は信頼できないものとして扱いました。
Sources
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch