NeurIPS 2025 E2LM 競賽:語言模型的早期訓練評估

Hugging Face 與相關機構宣布舉辦 NeurIPS 2025 E2LM(語言模型早期訓練評估)競賽。此計畫旨在打造新基準,能在大型語言模型(LLMs)訓練的早期階段(模型訓練約 200 億令牌或更少)有效捕捉推理與科學知識訊號。

早期階段評估的挑戰

現有的評估基準常無法在 LLM 開發的初期階段提供具辨別性的訊號。研究人員在進行消融實驗以測試架構、資料混合與超參數時,通常依賴訓練損失曲線與評估分數。然而,這些指標往往缺乏足夠的靈敏度,無法在模型處於早期訓練階段(約至 200B 令牌)時提供決定性的見解。

競賽框架與參與方式

參與者的任務是使用 lm-evaluation-harness 函式庫建立基準。提交透過專屬的 Hugging Face 組織與 Hugging Face Space 管理,活躍的排行榜會追蹤表現。

為降低參賽門檻,競賽使用可在免費版 Google Colab GPU 上執行的 Small Language Models (SLMs)。提供完整的起始套件,包含 notebook,協助參與者開始提交。

評估指標與計分方式

全局分數是三項主要指標的加權總和,旨在優先考量訊號品質與科學準確性:

  • 訊號品質分數(Score SQ): 權重為 0.5。
  • 科學知識符合度分數(Score CS): 權重為 0.4。
  • 排名一致性分數(Score RC): 權重為 0.1。

全局分數公式: Score = 0.5 * Score SQ + 0.1 * Score RC + 0.4 * Score CS

驗證程序

為確保結果的完整性,所有提交皆須通過兩項驗證檢查:

  1. 科學對齊: 驗證基準與已確立的科學知識領域相符。
  2. 資訊洩漏檢測: 檢查問題提示中是否包含答案,以防止資訊洩漏。

檢查點可取得性

為防止參賽者過度擬合特定模型,競賽採用分層存取檢查點的機制:

  • 本地計算: 參賽者可使用三個 SLM(0.5B、1B、3B 參數)的檢查點,在 0 到 200 BT 之間訓練,於本地計算訊號品質子分數。
  • 隱藏檢查點: 排名一致性及其他子分數透過 Hugging Face Space 自動計算,使用隱藏檢查點,包括從 200 GT 到 1 T 令牌訓練的模型,以及僅在網路資料上訓練的 0.5B 參數模型。

競賽時間表

階段 日期
啟動會議 14 July 2025
熱身階段 14 July 2025 - 17 August 2025
開發階段 18 August 2025 - 26 October 2025
最終階段 27 October 2025 - 03 November 2025
結果公布 04 November 2025
獲獎者說明文件與程式碼釋出 22 November 2025
NeurIPS 工作坊發表 6 or 7 December 2025

獎項與獎勵

  • 第一名: 6,000 美元
  • 第二名: 4,000 美元
  • 第三名: 2,000 美元
  • 學生獎項: 兩項獎勵,每項 2,000 美元,頒發給前兩名經學生驗證的解決方案。

Sources