Hugging Face 오픈 체인 오브 사고 리더보드

Hugging Face는 Open Chain of Thought (CoT) 리더보드를 출시했습니다. 이는 체인 오브 사고 프롬프트가 복잡한 추론 작업에서 모델의 정확도를 실제로 얼마나 향상시키는지를 측정하도록 설계된 특수 평가 프레임워크입니다. 절대 정확도를 추적하는 기존 리더보드와 달리, 이 리더보드는 추론 과정 자체가 제공하는 한계 이득에 초점을 맞춥니다.

정확도 향상을 통한 추론 영향 측정

Open CoT 리더보드는 CoT 프롬프트 사용 여부에 따른 모델 성능 차이를 계산하여 모델의 추론 트레이스 효과를 평가합니다. 이 접근 방식은 모델의 기본 지식으로부터 추론 과정의 영향을 분리하도록 설계되었습니다.

The Accuracy Gain Formula: accuracy gain Δ = accuracy with CoT – accuracy w/o CoT

베이스라인( CoT 없이 정확도)을 설정하기 위해, 리더보드는 다중 선택 평가에 로그우도 정확도를 사용합니다. 이 방법론은 학습 데이터 오염에 대해 보다 견고해지도록 목표합니다; 모델이 학습 중 특정 답을 본 적이 있더라도, 해당 답에 도달하기 위한 유효한 추론 경로를 생성하는 데 여전히 어려움을 겪을 수 있습니다.

평가 작업 및 벤치마크

리더보드는 상식 지식과 일반 추론을 필요로 하는 작업을 활용하여, 고성능 LLM에도 여전히 도전적이도록 합니다. 모든 작업은 다중 선택 문제 형태로 제공됩니다.

평가 스위트에는 다음이 포함됩니다:

  • LogiQA: 원본 버전과 버전 2.0의 새로운 번역을 포함합니다.
  • LSAT: 분석 추론, 논리 추론, 독해에 초점을 맞춘 하위 집합들.

이 작업들 대부분은 AGIEval 벤치마크에서 가져와 logikon-bench를 통해 재게시되었습니다.

CoT 생성 레짐 및 프롬프트 전략

다양한 CoT 프롬프트 기법을 고려하기 위해, 리더보드는 모듈식 프롬프트 체인을 사용하고 두 가지 프롬프트 전략과 세 가지 디코딩 파라미터의 조합인 여섯 가지 “생성 레짐”에 걸쳐 모델을 테스트합니다.

프롬프트 전략

  1. Classic: 문제를 제시한 뒤 “단계별로 생각해 보자”라는 지시가 이어집니다.
  2. Reflect: 모델에게 문제를 일반적인 관점에서 반성하도록 지시한 뒤 단계별 해결책을 진행합니다.

디코딩 파라미터

  • 탐욕 디코딩
  • 빔 서치 (n=2)
  • 샘플링 (T=.3)

테스트 데이터셋의 각 예제마다 모델은 여섯 레짐 각각에 대해 하나의 트레이스를 생성합니다. 리더보드는 각 모델/작업 쌍에 대해 이러한 레짐 중 어느 것이든 달성한 최고의 한계 정확도 향상을 보고합니다.

주요 발견 및 인사이트

30개 모델에 대한 평가 초기 결과는 오픈 LLM의 추론 능력에 관한 여러 추세를 보여줍니다:

  • 소형 모델의 효과성: 비교적 작은 모델(예: 7B 파라미터)도 효과적인 CoT 추론을 보여줄 수 있습니다. 경우에 따라 Phi-2와 같은 소형 모델이 Mixtral과 같은 대형 모델보다 CoT 트레이스로부터 더 큰 정확도 향상을 보이기도 합니다.
  • 파인튜닝의 영향: 인스트럭션 및 챗 파인튜닝은 성능을 크게 향상시킵니다. 파인튜닝은 베이스라인 정확도( CoT 없이)와 CoT 적용 시 얻는 한계 이득 모두를 개선합니다.
  • CoT 효과의 일관성 부족: 보편적으로 우수한 CoT 생성 레짐은 없습니다. 전략의 효과는 모델과 작업에 따라 다르며, 경우에 따라 CoT가 실제로 정확도를 감소시킬 수도 있어, 견고하고 신뢰할 수 있는 CoT 구현을 만드는 것이 여전히 과제임을 나타냅니다.

향후 개발 및 기여

Hugging Face는 여러 분야에서 리더보드를 확장하기 위한 커뮤니티 기여를 찾고 있습니다:

  • 모델 제출: 오픈 LLM은 리더보드의 HF 스페이스에 있는 Submission 탭을 통해 평가를 위해 제출할 수 있습니다.
  • 분석 도구: 베이스라인 정확도, 분산, 추론 트레이스 속성(예: 길이)을 시각화하는 Open CoT 대시보드 개발.
  • 전략 확대: 트리 오브 사고, 자기 일관성, 자기 검증, 토론 등 추가 CoT 레짐 구현.
  • 데이터셋 확대: 컴퓨팅 자원이 허용하는 한 더 도전적인 추론 작업을 포함.

Sources