Qwen1.5-110B 릴리스 노트 / 새로운 내용

Qwen은 Qwen1.5-110B를 출시했습니다. 이는 Qwen1.5 시리즈에서 처음으로 1000억 파라미터를 초과한 모델이며, 기본 능력과 채팅 기반 상호작용 모두에서 모델 크기 확대가 성능 향상을 지속적으로 제공한다는 것을 보여줍니다. 이 모델은 Llama-3-70B와 같은 다른 대규모 오픈소스 모델에 대한 경쟁력 있는 대안으로 자리매김합니다.

모델 아키텍처 및 기술 사양

Qwen1.5-110B는 Qwen1.5 시리즈의 다른 모델과 유사한 Transformer 디코더 아키텍처를 사용합니다. 주요 기술 사양은 다음과 같습니다:

  • Grouped Query Attention (GQA): 모델은 GQA를 도입하여 모델 서빙 시 효율성을 보장합니다.
  • Context Window: 32K 토큰의 컨텍스트 길이를 지원합니다.
  • Multilingual Support: 모델은 다국어 기능을 유지하며 영어, 중국어, 프랑스어, 스페인어, 독일어, 러시아어, 한국어, 일본어, 베트남어, 아랍어 등 다양한 언어를 지원합니다.

기본 모델 성능

Qwen1.5-110B는 여러 벤치마크에서 Meta-Llama3-70B 및 Mixtral-8x22B와 경쟁합니다. Qwen 팀은 사전 학습 및 사후 학습 레시피를 크게 변경하지 않고 모델 크기를 늘림으로써 Qwen1.5-72B 모델 대비 성능 향상을 달성했다고 밝혔습니다.

벤치마크 Qwen1.5-110B Qwen1.5-72B Llama-3-70B Mixtral-8x22B
MMLU 80.4 77.5 79.5 77.8
TheoremQA 34.9 29.3 32.0 35.9
GPQA 35.9 36.3 36.4 34.3
Hellaswag 87.5 86.0 88.0 88.7
BBH 74.8 65.5 76.6 69.2
ARC-C 69.6 65.9 68.8 70.7
GSM8K 85.4 79.5 79.2 78.6
MATH 49.6 34.1 41.0 41.7
HumanEval 52.4 41.5 45.7 45.1
MBPP 58.1 53.4 55.1 71.2

챗 모델 평가

채팅 전용 평가에서 Qwen1.5-110B-Chat은 Qwen1.5-72B-Chat 모델에 비해 크게 개선되었습니다. MT-Bench와 AlpacaEval 2.0 모두에서 Llama-3-70B-Instruct를 능가합니다.

모델 MT-Bench (평균 점수) AlpacaEval 2.0 (LC 승률)
Llama-3-70B-Instruct 8.85 34.40
Qwen1.5-72B-Chat 8.61 36.60
Qwen1.5-110B-Chat 8.88 43.90

모델 스케일링에 대한 시사점

Qwen1.5-110B의 출시로 모델 크기 확대를 통한 성능 향상의 여지가 여전히 크다는 점이 확인되었습니다. Qwen 팀은 Llama-3이 보여준 데이터 스케일링의 중요성을 인식하면서, 향후 릴리스(예: 곧 출시될 Qwen2)에서는 데이터와 모델 크기를 모두 확대하는 전략을 추구할 계획입니다.

SUMMARY: Qwen은 Qwen1.5 시리즈에서 처음으로 1000억 파라미터를 초과한 Qwen1.5-110B를 출시했으며, Llama-3-70B와 경쟁력 있는 성능을 제공하고 Qwen1.5-72B에 비해 크게 향상되었습니다.

TITLE: Qwen1.5-110B 릴리스 노트 / 새로운 내용

Sources