Hugging Face Open LLM Leaderboard:CO₂ 排放與模型性能分析

Hugging Face 已將碳排放估算整合進 Open LLM Leaderboard 中,以提高模型推理對環境影響的透明度。分析顯示,社群微調模型(community fine-tuned models)通常比官方版本具有更高的碳效率,這可能是由於輸出更簡潔且指令遵循能力更好。

計算 CO₂ 成本的方法論

為了估算模型評估對環境的影響,Hugging Face 使用了一種基於推理期間所使用的特定硬體和電力的啟發式方法。計算因素包括:

  • 評估時間: 推理過程的持續時間。
  • 能源使用: 集群硬體的功耗。
  • 碳強度: 為硬體供電的電力來源之特定碳足跡。

這些數據代表了用於 Open LLM Leaderboard 評估的特定推理設置期間產生的排放量,而非模型本身的通用常數。

模型性能與排放的總體趨勢

對超過 2,700 個模型的分析顯示,模型規模與 CO₂ 成本之間存在明顯的相關性,儘管性能增益並不總是與排放量成比例增長。

官方供應商模型

來自主要研究團隊和企業的官方模型(例如 Google、Meta、Alibaba)呈現以下模式:

  • 邊際效益遞減: 隨著模型規模增加,排行榜分數並不總是與 CO₂ 成本的上升成比例增加。
  • MoE 效率: Mixture-of-Experts (MoE) 模型可能表現出較差的排行榜分數與排放比,因為極長的推理時間可能會抵消僅激活部分參數所帶來的計算優勢。
  • 指令微調的冗長性: 雖然指令微調模型通常優於基礎模型,但有些模型過於冗長。這種冗長性在進行 MATH 和 IFEval 等生成式評估時,會增加推理時間和能源消耗。

社群版本

社群驅動的模型與官方版本呈現出不同的趨勢:

  • 小模型的高效率: 社群中參數低於 10B 的模型可以實現平均高達 35 分的評分,且 CO₂ 排放量低於 5kg。
  • 微調版本的卓越效率: 社群微調模型和合併模型(merges)往往比它們所基於的官方模型更具 CO₂ 效率。

詳細洞察:高參數模型 vs. 精簡模型

微調與排放之間的關係取決於模型規模。

高參數模型 (例如 70B)

對於像 Qwen2.5Llama3.1 這樣的大規模模型,官方微調版本消耗的能量可能是其基礎模型的兩倍。相比之下,對於 Qwen2,研究發現其基礎模型比其微調版本更耗能。

精簡模型 (7B+)

對於 7B+ 範圍的模型,沒有一致的趨勢。對於 Llama3.1Qwen2.5,基礎模型消耗的能量是微調版本的兩倍。然而,對於 Qwen2Mistral v0.3,社群微調版本顯示出更高的消耗。

個案研究:Qwen2 與 Llama 模型中的冗長性與效率

對特定模型行為的分析表明,冗長性和指令遵循能力是推理相關排放的主要驅動因素。

指令遵循的影響

基礎模型通常在指令遵循方面表現不佳,經常嘗試「接續」提示詞而非回答它。這會導致重複的模式或過長且不連貫的輸出。由於生成式任務需要推論更多 token,這種冗長性顯著增加了 CO₂ 排放。

  • Qwen2-72B 分析: 基礎模型 Qwen2-72B 產生的排放量遠高於社群微調模型 calme-2.1-qwen2-72b。社群微調版本提供了更簡潔、直接的回答,而基礎模型則產生了冗長且有時重複的文本。
  • Llama-3.1-8B 分析: 由於傾向於重複約束條件,基礎模型產生了極長的回答(例如單個任務產生 5,475 個字元)。雖然官方指令模型提高了連貫性並減少了冗長性,但社群微調模型 Llama-TI-8B 有時會產生元評論(meta-commentary)和長篇回答,與基礎模型類似。

結論與開放性問題

微調提高了輸出的連貫性和簡潔性,從而減輕了計算負擔並可能降低 CO₂ 排放。然而,確切的機制——是源於較短的 token 數量還是改進了任務終止——仍是一個待進一步研究的課題。

開放的研究問題包括:

  • MATH 或 IFEval 等基準測試中的數據集污染是否允許模型更早終止推理,從而人為地提高效率。
  • 聊天模型中的 token 解析和冗長性如何具體影響能源消耗。
  • 導致某些 MoE 架構出現異常高排放的因素。

Sources