Qwen 소개: 포괄적인 LLM 및 LMM 프레임워크

Qwen은 대형 언어 모델(LLM)과 대형 멀티모달 모델(LMM)을 통합하여 인공 일반 지능(AGI)을 달성하는 것을 목표로 하는 프로젝트입니다. 이 생태계에는 기본 언어 모델, 채팅 최적화 버전(Qwen-Chat), 코딩 전용 모델(Code-Qwen) 및 수학 전용 모델(Math-Qwen), 그리고 시각(Qwen-VL) 및 오디오(Qwen-Audio)용 멀티모달 확장이 포함됩니다.

기본 모델 아키텍처 및 스케일링

Qwen은 다음 토큰 예측을 사용해 사전 학습된 Transformer 기반 언어 모델입니다. 개발은 모델 크기와 데이터 양을 모두 확장하여 안정성과 성능을 보장하는 데 초점을 맞춥니다.

모델 변형 및 사양

개발된 다섯 모델 중 네 개는 오픈소스로 공개되었으며, 사양은 다음과 같습니다:

모델 출시일 최대 길이 시스템 프롬프트 강화 사전 학습 토큰 최소 GPU 메모리 (Q-Lora 파인튜닝) 최소 GPU 사용량 (2048 토큰 Int4) 도구 사용
Qwen-1.8B 23.11.30 32K 2.2T 5.8GB 2.9GB
Qwen-7B 23.08.03 32K 2.4T 11.5GB 8.2GB
Qwen-14B 23.09.25 8K 3.0T 18.7GB 13.0GB
Qwen-72B 23.11.30 32K 2.2T 61.4GB 48.9GB

다국어 능력 및 토크나이징

Qwen은 다국어 모델로 설계되어 영어와 중국어에서 강력한 능력을 보이며, 스페인어, 프랑스어, 일본어에서도 추가적인 숙련도를 갖추고 있습니다. 이는 여러 언어에 걸쳐 높은 압축률을 제공하는 고효율 토크나이저를 통해 정보를 최적화하여 인코딩함으로써 달성됩니다.

컨텍스트 길이 및 외삽

대부분의 오픈소스 Qwen 모델은 32K 토큰의 컨텍스트 길이를 지원합니다. 이는 더 긴 컨텍스트 길이로 지속적인 사전 학습과 Rotary Positional Embeddings(RoPE)의 기본값을 증가시켜 달성되었습니다. L-Eval 및 "Needle in a Haystack" 테스트를 통한 평가에서 모델이 장기간 컨텍스트 윈도우를 처리할 수 있음을 확인했습니다.

벤치마크 비교에서 Qwen-72B-Chat(32K)은 평균 점수 62.30을 기록했으며, TOEFL(86.24 대 78.43) 및 QuALITY(77.22 대 61.38) 등 여러 카테고리에서 ChatGPT-3.5-16k(60.73)보다 높은 성능을 보였습니다.

정렬 및 사후 학습

Qwen은 감독 미세조정(SFT)과 인간 피드백 기반 강화학습(RLHF)으로 구성된 두 단계 정렬 프로세스를 활용합니다.

감독 미세조정 (SFT)

정렬은 SFT로 시작되며, 팀은 instag와 tulu 2와 같은 데이터셋을 활용해 데이터의 다양성과 복잡성에 집중합니다. 품질은 수동 검토와 자동 평가를 결합하여 유지됩니다.

인간 피드백 기반 강화학습 (RLHF)

SFT 모델을 기반으로 Qwen은 PPO 기반 RLHF를 적용합니다. 학습 불안정을 해결하기 위해 팀은 대규모 비교 데이터로 사전 학습하고 고품질·정밀 라벨링된 비교 데이터로 파인튜닝한 신뢰할 수 있는 보상 모델을 개발했습니다. 결과적인 RLHF 모델은 SFT 전용 모델에 비해 창의성이 높고 지시 수행 능력이 향상되었습니다.

도구 사용 및 에이전시 능력

Qwen은 ReAct 형식에 따라 사고와 행동을 생성함으로써 에이전트로 작동하도록 설계되었습니다. 이를 통해 모델은 컨텍스트 내 학습을 통해 지시와 시연을 이해하여 훈련 중 보지 못한 도구도 사용할 수 있습니다.

지원 프레임워크

  • Function Calling: 특정 함수의 직접 실행.
  • Code Interpreter: 복잡한 데이터 분석에 사용됩니다.
  • Hugging Face Agent: 이미지 생성 등 다양한 출력을 위해 다양한 AI 모델과 통합됩니다.

AgentFabric

GPT 개념을 따라 Qwen은 간단한 채팅 기반 설정 과정을 통해 사용자가 특화된 AI 에이전트를 만들 수 있는 프레임워크인 AgentFabric을 도입했습니다.

Sources