Hugging Face ICML 2026 開源重現報告

Hugging Face 於 2026 年 7 月 15 日至 8 月 2 日組織了一場社群驅動的黑客松,利用編碼代理(coding agents)來重現 ICML 2026 會議的論文主張。這項工作共重現了 2,226 篇論文——約佔會議總數的三分之一——並生成了 6,816 份 Trackio 日誌簿,對 35,908 個獨立主張進行了判定。

大規模重現性研究結果

對所檢查論文的主張級判定進行分析後,發現重現性呈現顯著的分化:

  • 已驗證主張: 51% 的受檢論文(1,103 篇)至少有一個經過獨立驗證的主張。在這一組中,266 篇論文被完全重現(所有主張均已驗證),632 篇論文被部分重現且無偽造情況。總計有 3,978 個獨立主張透過實驗得到了確認。
  • 被偽造或有爭議的主張: 23% 的受檢論文(496 篇)至少有一個主張被判定為偽造或有爭議。這包括 49 篇論文的所有主張均被判定為偽造,以及 242 篇論文的不同重現團隊對相同的主張得出了相反的判定。
  • 不確定或玩具規模結果: 502 篇論文僅提供了玩具規模(toy-scale)的證據,而 280 篇論文仍無法得出結論,這通常是由于於缺少組件(artifacts)或專有數據集。

已確認偽造情況的技術分析

Hugging Face 對 35 個正式的偽造主張進行了對抗性重新驗證。研究中識別並確認了幾個備受關注的錯誤:

數學與證明錯誤

在論文 "Towards Optimal Robustness in Learning-Augmented Paging" 中,關於穩健性 $H_{k} + O(1)$ 的主張被判定為偽造。重現工作發現該加法項隨 $0.38 ext{ln } k$ 增長,這意味著真實的穩健性是 $H_{k} + ext{Θ}( ext{log } k)$。

在 "Attention's forward pass and Frank-Wolfe" 中,一個關於 token particle collapse 的定理被發現失效於第 224 步(隨後在第 3,800 步和第 6,416 步也失效了)。這些違規情況被其他審稿人忽略,因為有限時限的檢查過早停止了。

實作差異

在 "Self-Distillation Enables Continual Learning" 中,理論分析集中在反向 KL 散度(reverse KL divergence),但發布的代碼——即產生論文結果的代碼——卻使用了正向 KL 散度(forward KL)。此外,該論文宣稱的 +4pp 結果無法使用作者提供的代碼和數據來重現。

評估缺陷

在 "Do Transformers Need Three Projections?" 中,發現大約 66% 的評估標籤位置是 EOS padding tokens。這種填充(padding)使得困惑度(perplexity)降低了三倍,將報告的 "50% 緩存減少帶來的 3.1% 品質成本" 變更為大約 9.4%。

編碼代理在研究審計中的角色

這場黑客松利用了多種代理框架,包括 Claude Code, Codex, Cursor, 和 OpenResearch 的 orx。每一次重現都產生了一份包含撰寫報告、代碼、組件(artifacts)和代理執行軌跡的 Trackio 日誌簿。

代理的局限性

儘管效率很高,但代理遇到了幾種失效模式:

  • 局部循環: 代理偶爾會陷入重複執行的循環中。
  • 規模誤判: 一些代理驗證了實際上是錯誤的主張,因為它們在規模依賴性行為(例如 paging 論文中的 $ ext{log } k$ 增長)變得明顯之前就停止了實驗。
  • 單位不匹配: 一些偽造情況是基於代理對單位的錯誤假設。

人機協作的必要性

最可靠的結果來自於人類引導代理的工作流。例如,在重現一篇關於極端量化下穩定圖像生成的論文時,數值指標顯示沒有崩潰,但需要人類進行感知判斷,對 128 對圖像進行視覺判斷,以確定圖像是否真的可用。

黑客松方法論

為了促進審計,Hugging Face 索引了 6,341 篇被接受的 ICML 2026 論文,並提取了核心科學主張,為代理提供具體的目標。評估過程包括:

  1. 代理執行: 參與者使用他們選擇的代理來編寫代碼並運行實驗,並利用 HF Jobs 進行計算。

  2. 日誌簿生成: 每次運行都會生成一個靜態的 Hugging Face Space (Trackio 日誌簿) 以確保透明度。

  3. 自動化判定: 一個開源權重模型 (GLM-5.2) 擔任 Logbook Judge,對每個主張進行 verifiedfalsifiedtoyinconclusive 的判定,並將自我評估視為不可信。

Sources

相關