Hugging Face Open LLM Leaderboard:CO₂ 排放与模型性能分析

Hugging Face 已将碳排放估算整合到 Open LLM Leaderboard 中,以提高模型推理对环境影响的透明度。分析显示,社区微调模型通常比官方模型具有更高的碳效率,这可能是由于其输出更加简洁且指令遵循能力更好。

CO₂ 成本计算方法

为了估算模型评估对环境的影响,Hugging Face 使用了一种基于推理过程中使用的特定硬件和电力的启发式方法。计算因素包括:

  • 评估时间: 推理过程的持续时间。
  • 能源使用: 集群硬件的功耗。
  • 碳强度: 为硬件供电的电力来源的具体碳足迹。

这些数据代表了用于 Open LLM Leaderboard 评估的特定推理设置期间产生的排放,而不是模型本身的普遍常数。

模型性能与排放的总体趋势

对 2,700 多个模型的分析显示,模型规模与 CO₂ 成本之间存在明显的关联,尽管性能提升并不总是与排放成比例增长。

官方提供商模型

来自主要研究机构和公司的官方模型(例如 Google、Meta、Alibaba)呈现出以下模式:

  • 收益递减: 随着模型规模的增加,排行榜分数并不总是随 CO₂ 成本的上升而等比例增加。
  • MoE 效率: Mixture-of-Experts (MoE) 模型可能表现出较差的排行榜分数与排放比,因为极长的推理时间可能会抵消仅激活部分参数所带来的计算优势。
  • 指令微调的冗长性: 虽然指令微调模型通常优于基础模型,但有些模型非常冗长。这种冗长性在进行 MATH 和 IFEval 等生成式评估时,会增加推理时间和能源消耗。

社区发布版本

社区驱动的模型与官方发布版本呈现出不同的趋势:

  • 小模型的高效率: 来自社区的 10B 参数以下的模型可以实现高达 35 的平均分,而 CO₂ 排放量不足 5kg。
  • 微调版本的卓越效率: 社区微调和合并模型往往比它们所基于的官方模型更具 CO₂ 效率。

详细洞察:高参数模型 vs. 精简模型

微调与排放之间的关系取决于模型的规模。

高参数模型(例如 70B)

对于像 Qwen2.5Llama3.1 这样的大规模模型,官方微调版本消耗的能量可能是其基础模型的两倍。相比之下,对于 Qwen2,研究发现其基础模型比其微调版本更耗能。

精简模型 (7B+)

对于 7B+ 范围内的模型,没有统一的趋势。对于 Llama3.1Qwen2.5,基础模型的能耗是微调版本的两倍。然而,对于 Qwen2Mistral v0.3,社区微调版本显示出更高的能耗。

案例研究:Qwen2 和 Llama 模型中的冗长性与效率

对特定模型行为的分析表明,冗长性和指令遵循能力是推理相关排放的主要驱动因素。

指令遵循的影响

基础模型通常在指令遵循方面表现不佳,经常试图“延续”提示词而不是回答它。这会导致重复的模式或过长、不连贯的输出。由于生成式任务需要推断更多 token,这种冗长性显著增加了 CO₂ 排放。

  • Qwen2-72B 分析: 基础模型 Qwen2-72B 产生的排放远高于社区微调版本 calme-2.1-qwen2-72b。社区微调版本提供了更简洁、直接的回答,而基础模型则会产生冗长且有时重复的文本。
  • Llama-3.1-8B 分析: 由于倾向于重复约束条件,基础模型会产生极长的回答(例如,单个任务产生 5,475 个字符)。虽然官方指令模型提高了连贯性并减少了冗长性,但社区微调版本 Llama-TI-8B 有时会产生类似于基础模型的元评论和长篇回答。

结论与开放性问题

微调提高了输出的连贯性和简洁性,从而减轻了计算负荷并可能降低 CO₂ 排放。然而,确切的机制——究竟是因为更短的 token 计数还是改进的任务终止——仍是一个待进一步研究的课题。

开放的研究问题包括:

  • MATH 或 IFEval 等基准测试中的数据集污染是否允许模型更早地终止推理,从而人为地提高了效率。
  • 聊天模型中的 token 解析和冗长性如何具体影响能源消耗。
  • 导致某些 MoE 架构中排放异常升高的因素。

Sources