Qwen1.5 릴리즈 노트 / 새로운 소식
Qwen은 Qwen1.5를 출시했습니다. 이는 여러 크기의 오픈소스 베이스 및 챗 모델 시리즈와 MoE 버전으로, 인간 선호 정렬, 다국어 성능, 전반적인 개발자 경험을 개선하도록 설계되었습니다. 이 릴리즈는 모델을 Hugging Face transformers 라이브러리에 직접 통합함으로써 커스텀 원격 코드를 사용할 필요가 없게 하고 주요 배포 및 파인튜닝 프레임워크와의 호환성을 확대한다는 점에서 중요합니다.
모델 가용성 및 생태계 통합
Qwen1.5는 베이스 및 챗 모델을 0.5B, 1.8B, 4B, 7B, 14B, 32B, 72B, 110B의 8가지 크기와 Mixture-of-Experts (MoE) 모델으로 제공합니다. 다양한 배포 환경을 지원하기 위해 연구소는 Int4 및 Int8 GPTQ, AWQ, GGUF 포맷을 포함한 양자화 버전을 제공합니다.
개발자 경험 개선
Qwen1.5의 주요 기술적 변화는 코드가 Hugging Face transformers(버전 4.37.0 이상)와 병합된 것입니다. 이를 통해 개발자는 trust_remote_code=True를 설정하지 않고도 모델을 로드할 수 있습니다.
Qwen1.5는 다음 생태계에서도 기본적으로 지원됩니다:
- 배포: vLLM (>=0.3.0) 및 SGLang (>=0.1.11).
- 양자화: AutoAWQ 및 AutoGPTQ.
- 파인튜닝: Axolotl 및 LLaMA-Factory.
- 로컬 추론: llama.cpp, Ollama, 및 LMStudio.
- API 서비스: DashScope 및 together.ai.
기술 역량 및 성능
모든 Qwen1.5 모델은 일관되게 최대 32,768 토큰의 컨텍스트 길이를 지원합니다. 이 시리즈는 언어 이해, 코딩, 추론, 수학 전반에 걸쳐 강력한 성능을 보여줍니다.
기본 벤치마크
Qwen1.5-72B는 MMLU, C-Eval, GSM8K, MATH, HumanEval, MBPP, BBH 등 모든 평가 벤치마크에서 Llama2-70B보다 우수합니다. 7B 이하 파라미터의 소규모 모델에 대해서는 Qwen1.5-0.5B, 1.8B, 4B가 다른 커뮤니티 소형 언어 모델(SLM) 대비 매우 경쟁력 있는 대안으로 자리매김합니다.
인간 선호 정렬
Qwen1.5 챗 모델은 Direct Policy Optimization(DPO) 및 Proximal Policy Optimization(PPO)을 사용해 정렬되었습니다. MT-Bench와 AlpacaEval 2.0 결과에 따르면 Qwen1.5-72B-Chat은 Claude-2.1, GPT-3.5-Turbo-0613, Mixtral-8x7b-instruct, TULU 2 DPO 70B를 능가하며 Mistral Medium과 동등한 성능을 보입니다.
다국어 숙련도
베이스 모델은 유럽, 동아시아, 동남아시아의 12개 언어에 대해 평가되었습니다. 성능은 시험, 이해, 번역, 수학 네 가지 차원에서 측정되었습니다. Qwen1.5-72B는 아랍어, 스페인어, 프랑스어, 일본어, 한국어, 태국어 등에서 강력한 능력을 보여줍니다.
장기 컨텍스트 성능
L-Eval 벤치마크에서 Qwen1.5-72B-Chat은 GPT3.5-turbo-16k보다 크게 앞서며 GPT4-32k에 근접합니다. 더 작은 Qwen1.5-7B-Chat도 L-Eval 과제 5개 중 4개에서 GPT-3.5와 경쟁력을 가집니다.
외부 시스템 통합 및 에이전트 기능
Qwen1.5-Chat 모델은 Retrieval-Augmented Generation(RAG) 및 함수 호출을 통해 외부 지식과 통합되도록 설계되어 AI 에이전트 워크플로우에 활용됩니다.
RAG 및 도구 사용
- RAG: RGB 벤치마크에서 Qwen1.5-72B-Chat은 영어와 중국어 모두에서 강력한 성능을 보이며 특히 거절 및 통합 작업에서 뛰어납니다.
- Tool Selection: 도구 사용 벤치마크에서 Qwen1.5-72B-Chat은 도구 선택 및 입력 정확도에서 GPT-4에 근접한 성능을 보입니다.
- Agent Performance: T-Eval 벤치마크에서 Qwen1.5-72B-Chat은 영어와 중국어에서 높은 점수를 얻으며 특히 계획 및 검색에서 뛰어납니다.
코드 인터프리터
Qwen1.5-72B-Chat은 일반 코드 인터프리터 작업에서(정확도 87.9%) 좋은 성능을 보이지만, 특화된 수학 문제 해결 및 시각화 작업에서는 GPT-4에 뒤처집니다. Qwen 팀은 향후 버전에서 사전 학습 및 정렬 단계에서 코딩 능력 향상을 최우선 과제로 삼고 있습니다.
Sources
- OriginalIntroducing Qwen1.5