Hugging Face Hub에서 제로샷 평가

Hugging Face는 "Evaluation on the Hub" 도구를 통해 인과 언어 모델에 대한 제로샷 평가를 가능하게 했습니다. 이 업데이트는 연구자와 개발자가 라벨이 있는 학습 데이터나 맞춤형 GPU 인프라 없이도 분류 작업에서 모델 성능을 측정할 수 있게 하여, 매우 큰 언어 모델(LLM)의 벤치마킹 접근성을 민주화합니다.

제로샷 평가 인프라

"Evaluation on the Hub"은 AutoTrain이 지원하며 이제 Hub에 호스팅된 모든 인과 언어 모델에 대해 제로샷 분류를 지원합니다. 이 시스템은 수십억 파라미터 모델을 로드하고 컴파일하는 데 필요한 막대한 시간과 하드웨어 비용과 같은 대규모 모델 평가와 관련된 기술적·재정적 장벽을 제거합니다.

인프라의 주요 기술적 세부 사항은 다음과 같습니다:

  • Model Capacity: 이 도구는 현재 최대 660억 파라미터 모델을 지원하며, 향후 더 큰 모델도 지원할 계획입니다.
  • Performance: 2,000개의 문장 길이 예시를 사용한 제로샷 분류 작업에서 660억 파라미터 모델을 평가하는 데 약 3.5시간이 소요됩니다.
  • Mechanism: 제로샷 텍스트 분류 작업은 가능한 완성을 프롬프트에 연결하고 각 토큰의 로그 확률을 합산하는 방식으로 작동합니다. 그런 다음 이 값들을 정규화하고 정답 완성과 비교하여 정확도를 결정합니다.

사례 연구: WinoBias에서의 성별 편향

도구의 기능을 보여주기 위해 Hugging Face는 직업과 관련된 성별 편향을 측정하는 WinoBias 데이터셋을 사용해 다양한 OPT 모델을 평가했습니다. 이 작업에서 모델은 특정 직업을 언급하는 문장을 완성하기 위해 올바른 대명사(전형적 또는 반전형)를 선택해야 합니다.

평가 결과 "역스케일링" 경향이 나타났습니다: 작은 모델일수록 반전형 대명사를 선택할 가능성이 높았으며, 큰 모델일수록 성별과 직업 간의 전형적인 연관성에 의존하는 경향이 있었습니다. 이 결과는 BIG-Bench와 같은 다른 벤치마크 및 대규모·고성능 모델이 독성 텍스트를 생성하거나 인종, 민족, 국적과 관련된 편향을 보일 가능성이 더 높다는 기존 연구와 일치합니다.

AI 연구와 역스케일링에 대한 시사점

"Evaluation on the Hub"는 모델 크기나 FLOPS와 같은 다양한 축에 걸쳐 모델 행동을 분석할 수 있도록 돕는 로우코드 도구로 설계되었습니다. 제로샷 텍스트 분류 작업이 유연하기 때문에, 예시가 몇 단어만 다른 Winograd 스키마 형태로 포맷할 수 있는 모든 데이터셋을 벤치마킹에 활용할 수 있습니다.

이러한 접근성은 특정 작업에서 큰 모델이 작은 모델보다 성능이 떨어지는 "역스케일링 문제"를 연구하는 데 특히 유용합니다. Hugging Face는 커뮤니티가 이러한 도구를 활용해 해당 경향을 식별하고, 모델 크기와 성능 향상이 상관관계가 없는 작업을 찾는 것을 목표로 하는 Inverse Scaling Prize와 같은 이니셔티브에 기여하도록 장려합니다.

Sources