Qwen2.5-Max 릴리스 노트

Qwen은 Qwen2.5-Max의 출시를 발표했습니다. 이는 massive data와 model size를 통해 지능을 확장하도록 설계된 대규모 Mixture-of-Experts (MoE) 모델입니다. 이 모델은 Qwen Chat 인터페이스와 Alibaba Cloud에서 제공하는 OpenAI 호환 API를 통해 이제 사용할 수 있습니다.

모델 아키텍처 및 훈련

Qwen2.5-Max는 Mixture-of-Experts (MoE) 아키텍처를 기반으로 구축되었습니다. 20조 개 이상의 토큰으로 구성된 데이터셋에서 사전 학습되었습니다. 능력을 향상시키기 위해, 모델은 curated Supervised Fine-Tuning (SFT)와 Reinforcement Learning from Human Feedback (RLHF) 방법론을 사용한 후속 훈련을 거쳤습니다.

성능 벤치마크

Qwen2.5-Max는 여러 주요 벤치마크에서 proprietary 및 open-weight 모델과 경쟁력 있는 성능을 보여줍니다:

Instruct 모델 성능

GPT-4o, Claude-3.5-Sonnet, DeepSeek V3과 같은 최첨단 모델과 비교했을 때, Qwen2.5-Max instruct 모델은 다음 영역에서 DeepSeek V3보다 성능이 뛰어납니다:

  • Arena-Hard
  • LiveBench
  • LiveCodeBench
  • GPQA-Diamond

또한 MMLU-Pro에서 대학 수준 지식을 테스트하는 벤치마크에서 경쟁력 있는 결과를 보여줍니다.

Base 모델 성능

기본 모델 평가에서 Qwen2.5-Max는 Llama-3.1-405B, Qwen2.5-72B, DeepSeek V3과 비교되었습니다. Qwen 팀은 Qwen2.5-Max 기본 모델이 이러한 벤치마크의 대부분에서 상당한 장점을 보인다고 보고했습니다.

가용성 및 통합

Qwen2.5-Max (모델 이름 qwen-max-2025-01-25)는 두 가지 주요 채널을 통해 접근할 수 있습니다:

  1. Qwen Chat: 사용자는 모델과 직접 상호작용하여 아티팩트 및 검색과 같은 기능을 활용할 수 있습니다.
  2. Alibaba Cloud API: 이 API는 OpenAI 호환이며, 개발자는 표준 OpenAI Python 라이브러리를 사용하여 base_urlhttps://dashscope-intl.aliyuncs.com/compatible-mode/v1로 지정함으로써 모델을 통합할 수 있습니다.

미래 연구 방향

Qwen은 스케일링된 강화 학습을 적용하여 대형 언어 모델의 사고 및 추론 능력을 더욱 향상시키는 데 중점을 두고 있으며, 이를 통해 모델이 인간 수준의 지능을 넘어설 수 있도록 하는 것이 목표입니다.

Sources