Hugging Face Open LLM Leaderboard:CO₂ 排放与模型性能分析
Hugging Face 已将碳排放估算整合到 Open LLM Leaderboard 中,以提高模型推理对环境影响的透明度。分析显示,社区微调模型通常比官方模型具有更高的碳效率,这可能是由于其输出更加简洁且指令遵循能力更好。
CO₂ 成本计算方法
为了估算模型评估对环境的影响,Hugging Face 使用了一种基于推理过程中使用的特定硬件和电力的启发式方法。计算因素包括:
- 评估时间: 推理过程的持续时间。
- 能源使用: 集群硬件的功耗。
- 碳强度: 为硬件供电的电力来源的具体碳足迹。
这些数据代表了用于 Open LLM Leaderboard 评估的特定推理设置期间产生的排放,而不是模型本身的普遍常数。
模型性能与排放的总体趋势
对 2,700 多个模型的分析显示,模型规模与 CO₂ 成本之间存在明显的关联,尽管性能提升并不总是与排放成比例增长。
官方提供商模型
来自主要研究机构和公司的官方模型(例如 Google、Meta、Alibaba)呈现出以下模式:
- 收益递减: 随着模型规模的增加,排行榜分数并不总是随 CO₂ 成本的上升而等比例增加。
- MoE 效率: Mixture-of-Experts (MoE) 模型可能表现出较差的排行榜分数与排放比,因为极长的推理时间可能会抵消仅激活部分参数所带来的计算优势。
- 指令微调的冗长性: 虽然指令微调模型通常优于基础模型,但有些模型非常冗长。这种冗长性在进行 MATH 和 IFEval 等生成式评估时,会增加推理时间和能源消耗。
社区发布版本
社区驱动的模型与官方发布版本呈现出不同的趋势:
- 小模型的高效率: 来自社区的 10B 参数以下的模型可以实现高达 35 的平均分,而 CO₂ 排放量不足 5kg。
- 微调版本的卓越效率: 社区微调和合并模型往往比它们所基于的官方模型更具 CO₂ 效率。
详细洞察:高参数模型 vs. 精简模型
微调与排放之间的关系取决于模型的规模。
高参数模型(例如 70B)
对于像 Qwen2.5 和 Llama3.1 这样的大规模模型,官方微调版本消耗的能量可能是其基础模型的两倍。相比之下,对于 Qwen2,研究发现其基础模型比其微调版本更耗能。
精简模型 (7B+)
对于 7B+ 范围内的模型,没有统一的趋势。对于 Llama3.1 和 Qwen2.5,基础模型的能耗是微调版本的两倍。然而,对于 Qwen2 和 Mistral v0.3,社区微调版本显示出更高的能耗。
案例研究:Qwen2 和 Llama 模型中的冗长性与效率
对特定模型行为的分析表明,冗长性和指令遵循能力是推理相关排放的主要驱动因素。
指令遵循的影响
基础模型通常在指令遵循方面表现不佳,经常试图“延续”提示词而不是回答它。这会导致重复的模式或过长、不连贯的输出。由于生成式任务需要推断更多 token,这种冗长性显著增加了 CO₂ 排放。
- Qwen2-72B 分析: 基础模型
Qwen2-72B产生的排放远高于社区微调版本calme-2.1-qwen2-72b。社区微调版本提供了更简洁、直接的回答,而基础模型则会产生冗长且有时重复的文本。 - Llama-3.1-8B 分析: 由于倾向于重复约束条件,基础模型会产生极长的回答(例如,单个任务产生 5,475 个字符)。虽然官方指令模型提高了连贯性并减少了冗长性,但社区微调版本
Llama-TI-8B有时会产生类似于基础模型的元评论和长篇回答。
结论与开放性问题
微调提高了输出的连贯性和简洁性,从而减轻了计算负荷并可能降低 CO₂ 排放。然而,确切的机制——究竟是因为更短的 token 计数还是改进的任务终止——仍是一个待进一步研究的课题。
开放的研究问题包括:
- MATH 或 IFEval 等基准测试中的数据集污染是否允许模型更早地终止推理,从而人为地提高了效率。
- 聊天模型中的 token 解析和冗长性如何具体影响能源消耗。
- 导致某些 MoE 架构中排放异常升高的因素。