HELMET: 장기 컨텍스트 언어 모델을 전체적으로 평가하기
Hugging Face와 Princeton 연구원들은 HELMET (How to Evaluate Long-Context Models Effectively and Thoroughly)를 소개했다. 이는 장기 컨텍스트 언어 모델(LCLM)을 평가하기 위해 설계된 포괄적인 벤치마크이며, 기존 평가가 실제 성능과 상관관계가 낮은 합성 작업에 과도하게 의존하는 문제를 해결한다. HELMET는 8K에서 128K 토큰까지의 컨텍스트를 다루는 모델을 평가하기 위한 보다 신뢰할 수 있는 프레임워크를 제공한다.
합성 장기 컨텍스트 평가의 실패
기존 장기 컨텍스트 모델 평가 방법은 종종 퍼플렉시티나 "needle-in-a-haystack"(NIAH) 테스트와 같은 단순 합성 작업에 의존한다. 그러나 이러한 지표는 실제 다운스트림 성능을 반영하지 못하는 경우가 많다.
- 낮은 상관관계: NIAH와 같은 단순 합성 작업은 요약이나 인용을 포함한 생성과 같은 실제 작업과 잘 상관되지 않는다.
- 측정치 잡음: ROUGE와 같은 전통적인 n-gram 매칭 지표는 잡음이 많고 종종 다른 용량의 모델을 구분하거나 인간 판단과 상관관계를 나타내지 못한다.
- 벤치마크 제한: 많은 오래된 QA 데이터셋은 32K 토큰 이하로 제한되어 있어 현재 수백만 토큰을 지원하는 최첨단 모델을 테스트하기에 부족하다.
HELMET 프레임워크: 다양성, 제어, 신뢰성
HELMET는 다양하고, 제어 가능하며, 신뢰할 수 있는 평가 지표를 우선시함으로써 LCLM 능력을 전체적으로 조망하도록 설계되었다.
다양한 작업 커버리지
HELMET는 단일 도메인 테스트를 넘어 다양한 실제 응용을 포함한다:
- 검색 강화 생성 (RAG): 실제 검색 구절 사용.
- 인용을 포함한 생성: 모델이 정보를 출처와 함께 제공하는 능력 테스트.
- 요약: 자연스럽게 긴 문서 처리.
- 컨텍스트 내 학습 (ICL): 여러 시연으로부터 학습하는 모델의 능력 평가.
제어 가능한 길이와 난이도
HELMET는 입력 길이와 복잡성을 조정하여 도전 수준을 맞출 수 있다:
- 가변 입력: 길이는 검색 구절 수(RAG, Cite, Re-rank), 시연 수(ICL), 입력 문서 길이(LongQA 및 Summ)를 변경하여 제어할 수 있다.
- 확장성: 현재 실험은 8K~128K 토큰에 초점을 맞추지만, 프레임워크는 더 긴 컨텍스트로 쉽게 확장되도록 설계되었다.
신뢰할 수 있는 평가와 견고한 프롬프트
정확하고 실행 가능한 결과를 보장하기 위해 HELMET는 다음을 구현한다:
- 모델 기반 평가: n-gram 지표를 모델 기반 평가로 교체하여 서로 다른 용량의 모델을 더 잘 구분한다.
- 기본 모델 지원: 많은 벤치마크가 instruction-tuning을 요구하는 반면, HELMET는 인컨텍스트 학습 예시를 통해 기본 모델을 지원하여 초기 모델 개발에 유용하다.
59개 LCLM에서 도출된 주요 발견
59개의 독점 및 오픈소스 모델을 평가한 결과, 장기 컨텍스트 성능에 대한 몇 가지 중요한 추세가 확인되었다:
- 작업별 능력: 서로 다른 카테고리 간 성능이 항상 상관하지는 않는다. 예를 들어, 인컨텍스트 학습(ICL)은 다른 작업과 가장 낮은 상관관계를 보여 모델에 고유한 능력이 필요함을 시사한다.
- 오픈소스 격차: 오픈소스 모델은 Recall과 같은 단순 작업에서는 경쟁력 있지만, Citation과 같은 복잡한 작업에서는 폐쇄형 모델에 크게 뒤처진다.
- 길이 의존적 저하: 입력 길이가 늘어날수록 성능이 감소하지만, 이는 카테고리마다 다르다. GPT-4o와 Gemini와 같은 최첨단 모델도 컨텍스트가 커질수록 재랭킹과 같은 작업에서 큰 성능 저하를 겪는다.
- 보편적 승자는 없음: 모든 카테고리를 지배하는 단일 모델은 없으며, 다축 평가의 필요성을 강조한다.
구현 및 통합
HELMET는 GitHub을 통해 오픈소스 도구로 제공되며, 다양한 하드웨어 및 API 환경에 맞게 여러 배포 방식을 지원한다:
- Hugging Face 통합:
transformers라이브러리, Text Generation Inference (TGI), Inference Endpoints를 지원한다. - 대체 백엔드: vLLM(인텔 Gaudi 가속기 포함) 및 주요 제공자 API(OpenAI, Anthropic, Google, TogetherAI)와 호환된다.
- 빠른 반복: 연구진은 Recall과 RAG 작업을 사용해 빠른 개발 사이클을 권장한다. 이는 속도와 다른 현실적인 작업과의 상관관계 사이의 균형 때문이다.
향후 방향: 장문 생성
LCLM 평가를 더욱 확장하기 위해 팀은 LongProc를 통합하고 있다. LongProc는 장문 생성 및 절차 수행을 위한 벤치마크이다. HELMET가 긴 입력을 다루는 반면, LongProc는 긴 출력(최대 8K 토큰)을 생성하는 모델에 초점을 맞추며, 이는 광범위한 "사고 단계"를 활용하는 추론 모델 개발에 필수적이다.