Qwen 3.5‑397B‑A17B 출시: 1 M 토큰 컨텍스트와 최첨단 멀티모달 성능을 갖춘 하이브리드 선형‑어텐션 MoE 모델
TL;DR
Qwen 3.5‑397B‑A17B는 Qwen 3.5 시리즈의 첫 번째 오픈‑웨이트 모델로, 397 billion 파라미터 비전‑언어 모델이며, 순전파당 17 billion 파라미터만 활성화하여 언어, 코딩, 추론 및 멀티모달 벤치마크에서 최첨단 성능을 제공하면서 추론을 빠르고 저렴하게 유지합니다.
1. 발표 내용은?
Qwen AI는 Qwen 3.5‑397B‑A17B를 출시했으며, 이는 Qwen 3.5 시리즈의 첫 번째 모델입니다. 이는 네이티브 멀티모달 (비전‑언어) 모델로 Gated Delta Networks를 통한 선형 어텐션과 희소 Mixture‑of‑Experts (MoE) 아키텍처를 결합합니다. 397 B 파라미터 중 17 B만이 입력마다 활성화되어 이전 Qwen 3‑Max‑Base 대비 8.6× (32 k 컨텍스트)에서 19.0× (256 k 컨텍스트)까지 속도 향상을 제공하면서 비슷한 정확도를 유지합니다.
2. 핵심 기술 혁신
2.1 하이브리드 어텐션 + 희소 MoE
- Gated Delta Network (GDN) 은 선형 시간 어텐션을 제공하여 고전적인 자체 어텐션의 2차 비용을 크게 감소시킵니다.
- 희소 MoE 레이어는 각 토큰을 소수의 전문가에게 라우팅하여 전체 모델 크기에 관계없이 활성화된 파라미터 수를 17 B로 제한합니다.
- 이 조합은 높은 처리량을 제공하며 (256 k 컨텍스트에서 Qwen 3‑Max‑Base보다 최대 19× 빠름) 397 B 모델의 표현력을 희생하지 않습니다.
2.2 효율성 트릭
- 멀티‑토큰 예측 및 안정성 최적화는 극한 규모에서도 학습을 안정적으로 유지합니다.
- FP8 파이프라인 (활성화, MoE 라우팅, GEMM에 FP8 사용)은 활성화 메모리를 약 50 % 감소시키고 10 % 이상 속도 향상을 제공하며, 중요한 레이어는 BF16 정밀도를 유지합니다.
- 비동기 RL 프레임워크는 모든 Qwen 3.5 규모를 지원하며, 동적 로드 밸런싱과 낮은 그래디언트 오래됨을 통해 대규모 다중 턴, 다중 모달 강화 학습(RL) 훈련을 가능하게 합니다.
2.3 언어 커버리지
- 어휘가 250 k 토큰으로 확장되었습니다.
- 지원 언어가 119개에서 201개(다수의 방언 포함)로 증가하여 전 세계 접근성을 향상시켰습니다.
3. 벤치마크 성능
Qwen 3.5‑397B‑A17B는 다양한 최첨단 벤치마크에서 평가되었습니다. 아래 표는 가장 관련성 높은 점수를 강조합니다(높을수록 좋음, 별도 표기 제외). 모든 수치는 공식 Qwen 3.5 릴리스에서 가져왔습니다.
| 카테고리 | 벤치마크 | Qwen 3.5‑397B‑A17B | 가장 가까운 경쟁 모델 |
|---|---|---|---|
| Knowledge | MMLU‑Pro | 87.4 | GPT‑5.2 (89.5) |
| MMLU‑Redux | 95.0 | GPT‑5.2 (95.6) | |
| C‑Eval | 90.5 | Claude 4.5 Opus (92.2) | |
| Reasoning | LiveCodeBench v6 | 87.7 | GPT‑5.2 (84.8) |
| HMMT Feb 25 | 99.4 | Claude 4.5 Opus (92.9) | |
| Coding | Code‑Interpreter (IFEval) | 94.8 | GPT‑5.2 (90.9) |
| Multimodal | MMMU‑Pro | 85.0 | Gemini‑3 Pro (70.4) |
| MathVision | 84.2 | GPT‑5.2 (74.6) | |
| Real‑world VQA (RealWorldQA) | 81.0 | Gemini‑3 Pro (77.0) | |
| Agent / Tool use | General Agent (BFCL‑V4) | 63.1 | Claude 4.5 Opus (77.5) |
| Tool Decathlon | 43.8 | GPT‑5.2 (43.5) | |
| Search Agent (HLE w/ tool) | 45.5 | Gemini‑3 Pro (49.8) |
전반적으로 Qwen 3.5‑397B‑A17B는 언어, 추론, 코딩 및 멀티모달 작업에서 가장 강력한 기존 모델과 동등하거나 능가하면서도 추론 단계당 활성 파라미터를 훨씬 적게 사용합니다.
4. 멀티모달 기능
| 모달리티 | 대표 벤치마크 | Qwen 3.5‑397B‑A17B 점수 |
|---|---|---|
| STEM & Puzzle | MMMU | 85.0 |
| Math‑oriented vision | MathVista (mini) | 90.1 |
| General VQA | RealWorldQA | 81.0 |
| Document understanding | OmniDocBench 1.5 | 90.8 |
| OCR / Text‑in‑image | OCRBench | 93.1 |
| Spatial reasoning | RefCOCO (avg) | 87.8 |
| Video understanding | VideoMME (w/ sub.) | 87.4 |
이 모델은 최대 1 M 토큰(≈2시간 분량 비디오)을 단일 순전파에서 처리하여 엔드‑투‑엔드 비디오‑투‑코드, 비디오 요약 및 멀티모달 계획을 가능하게 합니다.
5. 시스템 수준 인프라스트럭처
- 이기종 병렬성: 비전 및 언어 파이프라인이 별도의 병렬 전략을 사용하여 단일 구조의 비효율성을 피합니다.
- 거의 100 %에 가까운 학습 처리량을 혼합 텍스트‑이미지‑비디오 데이터에서 순수 텍스트 기준에 비해 달성합니다.
- FP8 지원 파이프라인은 활성화 메모리를 약 50 % 절감하고 10 % 이상 속도 향상을 제공하며, 수치적으로 민감한 레이어는 BF16을 유지합니다.
- 확장 가능한 비동기 RL 엔진 – 다중 턴, 다중 모달 환경, 추측 디코딩, 롤아웃‑라우터 재생, 세밀한 오류 복구를 지원하며 3×–5× 엔드‑투‑엔드 속도 향상을 제공합니다.
6. Qwen 3.5 사용 방법
6.1 Qwen Chat (인터랙티브)
세 가지 상호작용 모드가 제공됩니다:
- Auto – 도구 사용(검색, 코드 인터프리터)과 적응형 추론.
- Thinking – 어려운 문제를 위한 깊은 사고 사슬.
- Fast – 도구 호출 없이 즉시 답변.
6.2 Qwen 3.5‑Plus (Alibaba Cloud ModelStudio에서 호스팅)
고급 기능을 환경 변수로 활성화합니다:
export DASHSCOPE_API_KEY=your_key
export DASHSCOPE_MODEL=qwen3.5-plus # optional override
# Enable reasoning chain‑of‑thought
export ENABLE_THINKING=true
# Enable web search & code interpreter
export ENABLE_SEARCH=true
간단한 Python 예시:
from openai import OpenAI
import os
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url=os.getenv("DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1"))
resp = client.chat.completions.create(
model=os.getenv("DASHSCOPE_MODEL", "qwen3.5-plus"),
messages=[{"role": "user", "content": "Introduce Qwen 3.5."}],
extra_body={"enable_thinking": True, "enable_search": False},
stream=True)
for chunk in resp:
print(chunk.choices[0].delta.get("content", ""), end="")
같은 엔드포인트는 Qwen Code, Qwen Visual Agents, 및 vibe‑coding 경험도 지원합니다.
7. 시사점 및 향후 방향
- 네이티브 멀티모달 추론: 트랜스포머 스택 초기에 비전을 결합함으로써 Qwen 3.5는 단일 패스에서 이미지, 비디오 및 텍스트를 추론할 수 있어 범용 AI 에이전트로 가는 결정적인 단계가 됩니다.
- 파라미터 효율적 스케일링: 토큰당 전체 파라미터의 4–5 %만 활성화함으로써 대규모 모델도 추론 시 과도한 비용이 필요 없음을 보여줍니다.
- 강화 학습 기반 에이전트: 비동기 RL 프레임워크는 장기, 다중 모달 환경에서 학습하는 에이전트를 훈련할 수 있게 하여 지속적이고 메모리 보강된 어시스턴트의 길을 엽니다.
- 광범위한 접근성: 201개 언어와 250 k 토큰 어휘를 지원함으로써 비영어 개발자와 기업의 장벽을 낮춥니다.
- 로드맵: Qwen 팀은 향후 기술 보고서를 예고했으며, 여기에는 더 큰 스케일 실험, 다양한 RL 환경, 외부 도구(예: 검색, 계획, 경제 인식)의 심층 통합이 상세히 다루어질 예정입니다.
8. 결론
Qwen 3.5‑397B‑A17B는 거대한 멀티모달 모델도 강력하면서 효율적일 수 있음을 증명합니다. 하이브리드 선형‑어텐션 + MoE 설계는 1 T 파라미터 모델에 필적하는 추론 비용으로 최첨단 정확도를 제공합니다. 오픈‑웨이트 릴리스, 방대한 벤치마크 스위트, 즉시 사용 가능한 클라우드 서비스는 차세대 AI 어시스턴트, 자율 에이전트 및 멀티모달 애플리케이션을 위한 매력적인 기반이 됩니다.
핵심 요약
- 총 397 B 파라미터, 토큰당 17 B 활성 → Qwen 3‑Max‑Base보다 최대 19× 빠름.
- 언어, 코딩, 추론 및 비전 작업에서 최첨단 결과.
- 1 M 토큰 컨텍스트 윈도우로 장시간 비디오 및 문서 처리 가능.
- 오픈‑웨이트 모델과 호스팅된 Qwen 3.5‑Plus를 통해 즉시 프로덕션에 활용 가능.
참고 문헌
- Qwen AI 블로그 게시물 – Qwen 3.5: Towards Native Multimodal Agents (2026‑02‑14).
- GitHub, Hugging Face, ModelScope에 있는 공식 모델 카드.
- 벤치마크 스위트: MMLU‑Pro, C‑Eval, LiveCodeBench v6, MMMU‑Pro, VideoMME 등.