Hugging Face Hub 碳排放追蹤
Hugging Face 已推出一套工具和整合,用於追蹤、報告與篩選基於二氧化碳 (CO2) 排放的機器學習模型。這些倡議旨在提升關於訓練與部署 AI 模型之環境影響的透明度,這些模型會因 GPU、儲存及其他計算基礎設施的能源消耗而產生 CO2 排放。
在 Hub 上依碳足跡篩選模型
huggingface_hub 函式庫現在加入了 emissions_threshold 參數,允許使用者依訓練排放量搜尋模型。這使開發者在選擇過程中能優先考慮環保、低排放的模型。
使用者可以指定 CO2 克數範圍來過濾結果。例如,使用 HfApi 類別,搜尋排放量最高為 100 克的模型會返回 191 個模型,其中包括 esiebomajeremiah/autonlp-email-classification-657119381(3.516 克)等範例。相反地,搜尋排放量最低為 500 克的模型則會找出較大且排放較高的模型,例如 Maltehb/aelaectra-danish-electra-small-cased(4009.5 克)。
使用 Transformers 自動追蹤排放
為了方便報告,Hugging Face 已將 codecarbon 整合至 transformers 函式庫。當系統上安裝了 codecarbon 後,Trainer 物件會在訓練過程中自動實作 CodeCarbonCallback。
此整合會自動在輸出目錄(例如 codecarbon-text-classification)中產生 emissions.csv 檔案。該檔案追蹤不同訓練執行的碳排放,讓研究人員能辨識最終模型版本所對應的具體排放量。
在模型卡中報告排放
透過在模型的中繼資料中直接加入排放資料,即可實現透明化。訓練完成且透過 codecarbon 追蹤排放後,使用者可以將 co2_eq_emissions 值添加至模型卡的最上方。
此標準化的中繼資料格式讓 Hugging Face Hub 能索引排放資料,並可透過上述的 emissions_threshold 參數進行搜尋。關於中繼資料格式的詳細指南可在官方 Hub 文件中找到。
影響 AI 碳排放的因素
機器學習模型全生命周期中排放的 CO2 總量由三個主要因素決定:
- Runtime:訓練過程的持續時間。
- Hardware:使用的特定計算資源(例如不同的 GPU 架構)。
- Carbon Intensity:為基礎設施供電之能源來源的碳足跡。