Qwen-Agent: 8k에서 1M 컨텍스트로 LLM 일반화
Qwen은 제한된 8k 컨텍스트 윈도우를 가진 대형 언어 모델(LLM)이 최대 100만 토큰을 포함하는 문서를 이해하고 처리할 수 있도록 하는 방법을 소개했습니다. 다중 레벨 에이전트 아키텍처를 구축함으로써 Qwen은 고품질 장기 컨텍스트 학습 데이터를 합성하여 궁극적으로 네이티브 1M 컨텍스트 챗 모델을 미세 조정할 수 있습니다.
3단계 에이전트 아키텍처
짧은 컨텍스트 윈도우의 한계를 극복하기 위해 Qwen은 세 단계에 걸쳐 복잡성이 증가하는 에이전트 시스템을 개발했으며, 각 단계는 장기 컨텍스트 처리의 특정 실패 모드를 해결합니다.
레벨 1: 키워드 기반 검색 보강 생성 (RAG)
레벨 1은 전통적인 RAG 접근 방식을 사용하여 관련 정보를 8k 토큰 윈도우에 맞춥니다. 검색 정확도를 높이기 위해 에이전트는 세 단계 프로세스를 따릅니다:
- Query Decomposition: 모델은 사용자 지시(예: "reply in English")를 실제 정보 질의(예: "when were bicycles invented")와 분리합니다.
- Keyword Extraction: 모델은 정보 질의에서 다국어 키워드를 추론합니다.
- BM25 Retrieval: 에이전트는 BM25 알고리즘을 사용하여 해당 키워드에 기반한 가장 관련성 높은 텍스트 청크를 찾습니다.
Qwen은 벡터 기반 검색이 별도의 임베딩 모델을 배포하는 추가 복잡성을 정당화할 만큼 충분히 큰 개선을 제공하지 못했다고 언급했습니다.
레벨 2: 청크별 읽기
관련 청크가 질의와 키워드가 겹치지 않아 발생하는 "missing needle" 문제를 방지하기 위해 레벨 2는 무차별 병렬 처리 전략을 사용합니다:
- Relevance Assessment: 512 토큰 청크마다 병렬로 처리됩니다. 모델은 각 청크를 평가하고 "None"을 출력하거나 관련 문장을 추출합니다.
- Refined Retrieval: 추출된 관련 문장은 새로운 검색 질의로 사용되어 BM25를 통해 가장 관련성 높은 청크를 검색합니다.
- Final Generation: 최종 답변은 이러한 정제된 검색 청크를 기반으로 생성됩니다.
레벨 3: 단계별 추론
답변에 여러 개의 이질적인 사실을 연결해야 하는 다중 홉 추론을 처리하기 위해 레벨 3은 레벨 2 에이전트를 ReAct 스타일의 툴 호출 에이전트 내 도구로 감쌉니다.
복잡한 질문에 직면하면 레벨 3 에이전트는 문제를 하위 질문으로 분해합니다. 레벨 2 에이전트를 반복적으로 질의하고 각 응답을 메모리에 추가하여 최종 답변을 제공할 충분한 정보를 얻을 때까지 진행합니다. 예를 들어, 베토벤의 제5교향곡과 같은 세기에 발명된 차량을 찾기 위해 에이전트는 먼저 교향곡의 세기를 식별한 뒤 해당 세기에 발명된 차량을 검색합니다.
성능 벤치마크
Qwen은 7B 챗 모델(“32k-Model”)을 사용해 에이전트를 테스트했으며, 표준 RAG 구현(“4k-RAG”) 및 전체 에이전트 전략(“4k-Agent”)과 비교했습니다. 테스트는 256k 컨텍스트에 대한 NeedleBench와 LV-Eval 벤치마크에서 수행되었습니다.
주요 결과:
- Short Contexts: 32k-Model은 짧은 컨텍스트의 여러 부분을 더 잘 처리할 수 있어 4k-RAG보다 성능이 우수할 수 있습니다.
- Long Contexts: 문서 길이가 증가함에 따라 4k-RAG가 일반적으로 32k-Model보다 우수하며, 이는 32k-Model이 장기 컨텍스트에 최적화되지 않았음을 나타냅니다.
- Agent Superiority: 4k-Agent는 벤치마크 전반에 걸쳐 32k-Model과 4k-RAG 모두보다 일관되게 우수한 성능을 보였습니다.
또한, 에이전트는 100만 토큰에 대한 “needle in a haystack” 압력 테스트를 성공적으로 통과했지만, Qwen은 현재 1M 토큰 실세계 애플리케이션에 대한 신뢰할 수 있는 정량적 벤치마크가 부족하다고 언급했습니다.
모델 훈련에 대한 시사점
이 에이전트 프레임워크는 데이터 생성 엔진 역할을 합니다. 자원봉사자와 에이전트 간의 상호작용을 기록하거나 에이전트를 사용해 다른 합성 데이터를 교차 검증함으로써 Qwen은 고품질의 장기 컨텍스트 파인튜닝 데이터셋을 만들 수 있습니다. 이 과정은 에이전트 수준의 능력을 네이티브 1M 컨텍스트 챗 모델에 증류할 수 있게 하며, 사실상 “약한” 8k 컨텍스트 모델을 사용해 “강한” 장기 컨텍스트 모델을 훈련시키는 효과를 제공합니다.
SUMMARY: Qwen은 8k 컨텍스트 모델이 1M 토큰을 처리할 수 있게 하는 에이전트 프레임워크를 개발했으며, 특정 벤치마크에서 RAG와 네이티브 장기 컨텍스트 모델을 모두 능가합니다.
TITLE: Qwen-Agent: 8k에서 1M 컨텍스트로 LLM 일반화