Hugging Face Open LLM リーダーボード: CO₂ 排出量とモデル パフォーマンス分析
Hugging Face は、モデル推論の環境への影響についての透明性を提供するために、Open LLM Leaderboard に炭素排出量の見積もりを統合しました。分析によると、コミュニティ ファインチューン モデルは、より簡潔な出力と指示への従順性の向上により、公式の対応するモデルよりもしばしば高いカーボン効率を達成します。
CO₂ コストの計算方法
モデル評価の環境への影響を推定するために、Hugging Face は推論中に使用される特定のハードウェアと電力に基づくヒューリスティックを使用します。計算には以下の要素が含まれます:
- Evaluation time: 推論プロセスの期間。
- Energy usage: クラスターのハードウェアの電力消費。
- Carbon intensity: ハードウェアを動かす電力源の特定の炭素フットプリント。
このデータは、Open LLM Leaderboard 評価で使用される特定の推論セットアップ中に生成される排出量を表しており、モデル自身の普遍的な定数ではありません。
モデル パフォーマンスと排出量の一般的な傾向
2,700 を超えるモデルの分析から、モデル サイズと CO₂ コストの間に明確な相関があることが示されていますが、パフォーマンスの向上が排出量に比例して常にスケールするわけではありません。
公式プロバイダー モデル
主要な研究グループや企業(例:Google, Meta, Alibaba)からの公式モデルは、以下のパターンを示します:
- Diminishing Returns: モデル サイズが増加するにつれて、リーダーボード スコアが CO₂ コストの増加に比例して常に上がるとは限らない。
- MoE Efficiency: Mixture-of-Experts (MoE) モデルは、極端に長い推論時間がパラメータのサブセットのみを活性化する計算上の利点を相殺するため、リーダーボード スコア対排出量の比率が悪くなる可能性があります。
- Instruction Tuning Verbosity: 指示チューニングされたモデルは一般的にベース モデルを上回る性能を示しますが、一部は過度に冗長です。この冗長性は、MATH や IFEval などの生成的評価における推論時間とエネルギー消費を膨らませます。
コミュニティ リリース
コミュニティ主導のモデルは、公式リリースと比較して明確な傾向を示します:
- High Efficiency in Small Models: 10B パラメータ未満のコミュニティ モデルは、5kg 未満の CO₂ で平均スコア最大 35 を達成できます。
- Superior Efficiency in Fine-tunes: コミュニティ ファインチューンとマージは、それらのベースとなる公式モデルよりもカーボン効率が高い傾向があります。
詳細な洞察: 高パラメータ モデル vs. コンパクト モデル
ファインチューニングと排出量の関係は、モデルのスケールによって異なります。
高パラメータ モデル(例:70B)
Qwen2.5 や Llama3.1 のような大規模モデルでは、公式のファインチューン バージョンはベース モデルのエネルギー消費の 2 倍になることがあります。対照的に、Qwen2 では、ベース モデルがファインチューン バージョンよりもはるかにエネルギー集約的であることがわかりました。
コンパクト モデル(7B+)
7B+ 範囲のモデルには一貫した傾向はありません。Llama3.1 と Qwen2.5 では、ベース モデルがファインチューン バージョンのエネルギー消費の 2 倍になります。ただし、Qwen2 と Mistral v0.3 では、コミュニティ ファインチューンがより高い消費を示しました。
ケース スタディ: Qwen2 と Llama モデルにおける冗長性と効率
特定のモデルの動作の分析から、冗長性と指示に従う能力が推論関連の排出量の主な要因であることが示唆されます。
指示に従うことの影響
ベース モデルはしばしば指示に従うことが苦手で、プロンプトに答えるのではなく「続ける」ことを試みがちです。これにより、繰り返しパターンまたは過度に長く incoherent(意味が通じない)出力が生じます。生成タスクではより多くのトークンを推論する必要があるため、この冗長性は CO₂ 排出量を大幅に増加させます。
- Qwen2-72B Analysis: ベース モデル
Qwen2-72Bは、コミュニティ ファインチューンcalme-2.1-qwen2-72bと比べてはるかに高い排出量を生成しました。コミュニティ ファインチューンはより簡潔で直接的な応答を提供し、一方でベース モデルは冗長で時折繰り返しの多いテキストを生成しました。 - Llama-3.1-8B Analysis: ベース モデルは、制約を繰り返す傾向があるため、単一のタスクで 5,475 文字(例)と非常に長い応答を生成しました。公式の instruct モデルは一貫性を向上させ、冗長性を減らしましたが、コミュニティ ファインチューン
Llama-TI-8Bは時折メタコメントと長い応答を生成し、ベース モデルと同様のことがありました。
結論とオープンな質問
ファインチューニングは出力の一貫性と簡潔さを向上させ、これにより計算負荷が軽減され、潜在的に CO₂ 排出量を低減します。ただし、正確なメカニズム—トークン数が短いことによるのか、タスク終了が改善されたことによるのか—は、さらなる研究の対象となっています。
オープンな研究課題には:
- MATH や IFEval などのベンチマークにおけるデータセットの汚染が、モデルが推論を早期に終了させ、人為的に効率を向上させることを許すかどうか。
- チャット モデルにおけるトークンのパースと冗長性が、エネルギー消費にどのように具体的に影響するか。
- 特定の MoE アーキテクチャにおいて予期せぬ高い排出量を引き起こす要因。