NeurIPS 2025 E2LM 竞赛:语言模型的早期训练评估

Hugging Face 及其关联机构已宣布 NeurIPS 2025 E2LM(语言模型的早期训练评估)竞赛。该倡议旨在创建新的基准,能够在训练早期有效捕捉大型语言模型(LLMs)中的推理和科学知识信号,特别是当模型已训练约 2000 亿 token 或更少时。

早期阶段评估的挑战

现有的评估基准往往无法在 LLM 开发的初始阶段提供区分性的信号。当研究人员进行消融实验以测试架构、数据混合和超参数时,通常依赖训练损失曲线和评估分数。然而,这些指标往往缺乏足够的灵敏度,无法在模型处于早期训练阶段(约 2000 亿 token 以内)时提供决定性的洞察。

竞赛框架与参与方式

参赛者需要使用 lm-evaluation-harness 库构建基准。提交通过专门的 Hugging Face 组织和 Hugging Face Space 管理,活跃的排行榜实时跟踪表现。

为降低参赛门槛,竞赛使用可在免费版 Google Colab GPU 上运行的小型语言模型(SLMs)。我们提供了包括 notebook 在内的完整入门套件,帮助参赛者开始提交。

评估指标与计分

每个提交的全局得分是三个主要指标的加权和,旨在优先考虑信号质量和科学准确性:

  • 信号质量分数(Score SQ): 权重 0.5。
  • 科学知识符合度分数(Score CS): 权重 0.4。
  • 排名一致性分数(Score RC): 权重 0.1。

全局得分公式: Score = 0.5 * Score SQ + 0.1 * Score RC + 0.4 * Score CS

验证流程

为确保结果的完整性,所有提交需通过两项验证检查:

  1. 科学对齐: 验证基准是否符合已建立的科学知识领域。
  2. 泄漏检测: 检查问题提示中是否包含答案,以防信息泄漏。

检查点可访问性

为防止参赛者对特定模型过度拟合,竞赛采用分层访问的检查点系统:

  • 本地计算: 参赛者可使用三个 SLM(0.5B、1B、3B 参数)的检查点,在 0 到 200 BT 之间本地计算信号质量子得分。
  • 隐藏检查点: 排名一致性及其他子得分通过 Hugging Face Space 自动使用隐藏检查点计算,包含从 200 GT 到 1 T token 训练的模型以及仅在网络数据上训练的 0.5B 参数模型。

竞赛时间表

阶段 日期
启动 14 July 2025
热身阶段 14 July 2025 - 17 August 2025
开发阶段 18 August 2025 - 26 October 2025
最终阶段 27 October 2025 - 03 November 2025
结果公布 04 November 2025
获奖者信息表与代码发布 22 November 2025
NeurIPS 研讨会展示 6 or 7 December 2025

奖项与奖励

现金奖励将颁发给整体排名前三以及特定学生成就:

  • 第一名: 6,000 美元
  • 第二名: 4,000 美元
  • 第三名: 2,000 美元
  • 学生奖项: 为排名前两位的学生验证方案各颁发 2,000 美元。

Sources