Hugging Face Open LLM Leaderboard: CO₂ 배출량 및 모델 성능 분석

Hugging Face는 모델 추론의 환경 영향에 대한 투명성을 제공하기 위해 Open LLM Leaderboard에 탄소 배출 추정치를 통합했습니다. 분석 결과, 커뮤니티 파인튜닝 모델은 공식 모델보다 탄소 효율성이 더 높은 경우가 많으며, 이는 보다 간결한 출력과 더 나은 지시 사항 준수 때문일 가능성이 있습니다.

CO₂ 비용 계산 방법론

모델 평가의 환경 영향을 추정하기 위해 Hugging Face는 추론 중에 사용된 특정 하드웨어와 전기를 기반으로 한 휴리스틱을 사용합니다. 계산에 포함되는 요소는 다음과 같습니다:

  • Evaluation time: 추론 과정의 지속 시간.
  • Energy usage: 클러스터 하드웨어의 전력 소비.
  • Carbon intensity: 하드웨어에 전력을 공급하는 전력원의 특정 탄소 발자국.

이 데이터는 Open LLM Leaderboard 평가에 사용된 특정 추론 설정에서 발생한 배출량을 나타내며, 모델 자체에 대한 보편적인 상수가 아닙니다.

모델 성능 및 배출량의 일반적인 동향

2,700개 이상의 모델 분석 결과, 모델 크기와 CO₂ 비용 사이에 명확한 상관관계가 있음을 보여주지만, 성능 향상이 항상 배출량과 비례하여 증가하는 것은 아닙니다.

공식 제공업체 모델

주요 연구 그룹 및 기업(예: Google, Meta, Alibaba)의 공식 모델은 다음과 같은 패턴을 보입니다:

  • Diminishing Returns: 모델 크기가 증가함에 따라 리더보드 점수가 CO₂ 비용 증가에 비례하여 항상 증가하지는 않습니다.
  • MoE Efficiency: Mixture-of-Experts (MoE) 모델은 극도로 긴 추론 시간으로 인해 부분적인 파라미터만 활성화하는 계산적 이점을 상쇄할 수 있어 리더보드 점수 대비 배출 비율이 낮을 수 있습니다.
  • Instruction Tuning Verbosity: instruction-tuned 모델은 일반적으로 기본 모델보다 성능이 우수하지만, 일부는 지나치게 장황합니다. 이 장황함은 MATH 및 IFEval과 같은 생성적 평가에서 추론 시간과 에너지 소비를 증가시킵니다.

커뮤니티 출시물

커뮤니티 주도 모델은 공식 출시물과 비교하여 뚜렷한 경향을 보입니다:

  • High Efficiency in Small Models: 10B 미만의 파라미터를 가진 커뮤니티 모델은 5kg 미만의 CO₂로 평균 점수 최대 35를 달성할 수 있습니다.
  • Superior Efficiency in Fine-tunes: 커뮤니티 파인튜닝 및 병합 모델은 기반이 되는 공식 모델보다 탄소 효율성이 더 높은 경향이 있습니다.

상세 인사이트: 고파라미터 모델 vs. 컴팩트 모델

파인튜닝과 배출량 사이의 관계는 모델 규모에 따라 달라집니다.

고파라미터 모델 (예: 70B)

Qwen2.5Llama3.1과 같은 대규모 모델의 경우, 공식 파인튜닝 버전이 기본 모델보다 두 배 많은 에너지를 소비할 수 있습니다. 반면, Qwen2의 경우 기본 모델이 파인튜닝 버전보다 훨씬 더 에너지 집약적인 것으로 나타났습니다.

컴팩트 모델 (7B+)

7B+ 범위의 모델에는 일관된 경향이 없습니다. Llama3.1Qwen2.5의 경우 기본 모델이 파인튜닝 버전보다 두 배 많은 에너지를 소비합니다. 그러나 Qwen2Mistral v0.3의 경우 커뮤니티 파인튜닝이 더 높은 소비를 보였습니다.

사례 연구: Qwen2 및 Llama 모델의 장황함과 효율성

특정 모델 행동 분석에 따르면, 장황함과 지시 사항을 따르는 능력이 추론 관련 배출의 주요 원인입니다.

지시 사항 준수의 영향

기본 모델은 지시 사항 준수에 자주 어려움을 겪으며, 질문에 답하기보다는 프롬프트를 '계속'하려는 시도를 자주 합니다. 이로 인해 반복 패턴이나 지나치게 길고 일관되지 않은 출력이 발생합니다. 생성적 작업은 더 많은 토큰을 추론해야 하므로 이 장황함이 CO₂ 배출을 크게 증가시킵니다.

  • Qwen2-72B Analysis: 기본 모델 Qwen2-72B는 커뮤니티 파인튜닝 calme-2.1-qwen2-72b보다 훨씬 높은 배출량을 보였습니다. 커뮤니티 파인튜닝은 더 간결하고 직접적인 응답을 제공했으며, 기본 모델은 장황하고 때때로 반복적인 텍스트를 생성했습니다.
  • Llama-3.1-8B Analysis: 기본 모델은 제약을 반복하려는 경향으로 인해 extrêmement 긴 응답(예: 단일 작업에 5,475 문자)을 생성했습니다. 공식 인스트럭트 모델은 일관성을 개선하고 장황함을 줄였지만, 커뮤니티 파인튜닝 Llama-TI-8B는 때때로 메타 코멘터리와 긴 응답을 생성했으며, 이는 기본 모델과 유사했습니다.

결론 및 열린 질문

파인튜닝은 출력 일관성과 간결성을 향상시켜 계산 부하를 줄이고 잠재적으로 CO₂ 배출을 낮춥니다. 그러나 정확한 메커니즘—더 짧은 토큰 수 때문인지 아니면 작업 종료 개선 때문인지—은 추가 연구가 필요한 주제로 남아 있습니다.

열린 연구 질문 포함:

  • MATH 또는 IFEval과 같은 벤치마크에서의 데이터셋 오염이 모델이 추론을 조기에 종료하도록 허용하여 인위적으로 효율성을 향상시킬 수 있는지 여부.
  • 채팅 모델에서의 토큰 파싱 및 장황함이 에너지 소비에 구체적으로 어떻게 영향을 미치는지.
  • 특정 MoE 아키텍처에서 예기치 않게 높은 배출량을 유발하는 요인들.

Sources