NVIDIA/RULER
This repo contains the source code for RULER: What’s the Real Context Size of Your Long-Context Language Models?
해결하는 문제
RULER는 대규모 언어 모델(LLM)의 "유효한" 컨텍스트 윈도우를 측정하는 엄격한 방법을 제공합니다. 많은 모델이 매우 긴 컨텍스트(예: 128k 토큰)를 지원한다고 주장하지만, 단순한 "needle-in-a-haystack" 테스트를 통과하더라도 입력 길이가 증가함에 따라 성능이 크게 저하되는 경우가 많습니다. RULER는 모델의 성능이 실제로 저하되기 시작하는 지점을 식별합니다.
작동 방식
설정 가능한 시퀀스 길이와 복잡도 수준으로 모델을 테스트하기 위해 네 가지 작업 카테고리에 걸쳐 합성 평가 예제를 생성합니다:
- Retrieval: 특정 정보를 찾는 능력 테스트(예: 건초더미 속의 여러 개의 "바늘").
- Multi-hop Tracing: 긴 텍스트 전반에 걸친 변수 이름 바인딩 체인 추적.
- Aggregation: 공통 단어 추출 또는 단어 빈도 계산.
- Question Answering: SQuAD 및 HotpotQA와 같은 데이터셋을 사용하여 긴 컨텍스트에 대한 이해도 테스트.
대상
모델이 주장하는 시퀀스 길이를 실제로 처리할 수 있는지 확인하기 위해 단순한 회상 테스트를 넘어 LLM의 실제 긴 컨텍스트 능력을 벤치마킹해야 하는 AI 연구자 및 개발자.
주요 특징
- 단순 회상 그 이상: 기본적인 needle-in-a-haystack 테스트를 넘어 긴 시퀀스에 대한 복잡한 추론 및 집계를 평가합니다.
- 구성 가능한 복잡도: 사용자가 작업 난이도(예: 체인의 홉 수 또는 찾아야 할 바늘의 수)를 조정할 수 있습니다.
- 광범위한 벤치마킹: 다양한 오픈 소스 및 독점 모델에 대한 결과가 포함되어 있습니다.
- 확장성: 기여자가 새로운 합성 작업 및 평가 지표를 추가할 수 있는 명확한 파이프라인을 제공합니다.
관련
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트