Qwen 3.5‑397B‑A17B 출시: 1 M 토큰 컨텍스트와 최첨단 멀티모달 성능을 갖춘 하이브리드 선형‑어텐션 MoE 모델

TL;DR

Qwen 3.5‑397B‑A17B는 Qwen 3.5 시리즈의 첫 번째 오픈‑웨이트 모델로, 397 billion 파라미터 비전‑언어 모델이며, 순전파당 17 billion 파라미터만 활성화하여 언어, 코딩, 추론 및 멀티모달 벤치마크에서 최첨단 성능을 제공하면서 추론을 빠르고 저렴하게 유지합니다.


1. 발표 내용은?

Qwen AI는 Qwen 3.5‑397B‑A17B를 출시했으며, 이는 Qwen 3.5 시리즈의 첫 번째 모델입니다. 이는 네이티브 멀티모달 (비전‑언어) 모델로 Gated Delta Networks를 통한 선형 어텐션과 희소 Mixture‑of‑Experts (MoE) 아키텍처를 결합합니다. 397 B 파라미터 중 17 B만이 입력마다 활성화되어 이전 Qwen 3‑Max‑Base 대비 8.6× (32 k 컨텍스트)에서 19.0× (256 k 컨텍스트)까지 속도 향상을 제공하면서 비슷한 정확도를 유지합니다.

2. 핵심 기술 혁신

2.1 하이브리드 어텐션 + 희소 MoE

  • Gated Delta Network (GDN) 은 선형 시간 어텐션을 제공하여 고전적인 자체 어텐션의 2차 비용을 크게 감소시킵니다.
  • 희소 MoE 레이어는 각 토큰을 소수의 전문가에게 라우팅하여 전체 모델 크기에 관계없이 활성화된 파라미터 수를 17 B로 제한합니다.
  • 이 조합은 높은 처리량을 제공하며 (256 k 컨텍스트에서 Qwen 3‑Max‑Base보다 최대 19× 빠름) 397 B 모델의 표현력을 희생하지 않습니다.

2.2 효율성 트릭

  • 멀티‑토큰 예측안정성 최적화는 극한 규모에서도 학습을 안정적으로 유지합니다.
  • FP8 파이프라인 (활성화, MoE 라우팅, GEMM에 FP8 사용)은 활성화 메모리를 약 50 % 감소시키고 10 % 이상 속도 향상을 제공하며, 중요한 레이어는 BF16 정밀도를 유지합니다.
  • 비동기 RL 프레임워크는 모든 Qwen 3.5 규모를 지원하며, 동적 로드 밸런싱과 낮은 그래디언트 오래됨을 통해 대규모 다중 턴, 다중 모달 강화 학습(RL) 훈련을 가능하게 합니다.

2.3 언어 커버리지

  • 어휘가 250 k 토큰으로 확장되었습니다.
  • 지원 언어가 119개에서 201개(다수의 방언 포함)로 증가하여 전 세계 접근성을 향상시켰습니다.

3. 벤치마크 성능

Qwen 3.5‑397B‑A17B는 다양한 최첨단 벤치마크에서 평가되었습니다. 아래 표는 가장 관련성 높은 점수를 강조합니다(높을수록 좋음, 별도 표기 제외). 모든 수치는 공식 Qwen 3.5 릴리스에서 가져왔습니다.

카테고리 벤치마크 Qwen 3.5‑397B‑A17B 가장 가까운 경쟁 모델
Knowledge MMLU‑Pro 87.4 GPT‑5.2 (89.5)
MMLU‑Redux 95.0 GPT‑5.2 (95.6)
C‑Eval 90.5 Claude 4.5 Opus (92.2)
Reasoning LiveCodeBench v6 87.7 GPT‑5.2 (84.8)
HMMT Feb 25 99.4 Claude 4.5 Opus (92.9)
Coding Code‑Interpreter (IFEval) 94.8 GPT‑5.2 (90.9)
Multimodal MMMU‑Pro 85.0 Gemini‑3 Pro (70.4)
MathVision 84.2 GPT‑5.2 (74.6)
Real‑world VQA (RealWorldQA) 81.0 Gemini‑3 Pro (77.0)
Agent / Tool use General Agent (BFCL‑V4) 63.1 Claude 4.5 Opus (77.5)
Tool Decathlon 43.8 GPT‑5.2 (43.5)
Search Agent (HLE w/ tool) 45.5 Gemini‑3 Pro (49.8)

전반적으로 Qwen 3.5‑397B‑A17B는 언어, 추론, 코딩 및 멀티모달 작업에서 가장 강력한 기존 모델과 동등하거나 능가하면서도 추론 단계당 활성 파라미터를 훨씬 적게 사용합니다.

4. 멀티모달 기능

모달리티 대표 벤치마크 Qwen 3.5‑397B‑A17B 점수
STEM & Puzzle MMMU 85.0
Math‑oriented vision MathVista (mini) 90.1
General VQA RealWorldQA 81.0
Document understanding OmniDocBench 1.5 90.8
OCR / Text‑in‑image OCRBench 93.1
Spatial reasoning RefCOCO (avg) 87.8
Video understanding VideoMME (w/ sub.) 87.4

이 모델은 최대 1 M 토큰(≈2시간 분량 비디오)을 단일 순전파에서 처리하여 엔드‑투‑엔드 비디오‑투‑코드, 비디오 요약 및 멀티모달 계획을 가능하게 합니다.

5. 시스템 수준 인프라스트럭처

  • 이기종 병렬성: 비전 및 언어 파이프라인이 별도의 병렬 전략을 사용하여 단일 구조의 비효율성을 피합니다.
  • 거의 100 %에 가까운 학습 처리량을 혼합 텍스트‑이미지‑비디오 데이터에서 순수 텍스트 기준에 비해 달성합니다.
  • FP8 지원 파이프라인은 활성화 메모리를 약 50 % 절감하고 10 % 이상 속도 향상을 제공하며, 수치적으로 민감한 레이어는 BF16을 유지합니다.
  • 확장 가능한 비동기 RL 엔진 – 다중 턴, 다중 모달 환경, 추측 디코딩, 롤아웃‑라우터 재생, 세밀한 오류 복구를 지원하며 3×–5× 엔드‑투‑엔드 속도 향상을 제공합니다.

6. Qwen 3.5 사용 방법

6.1 Qwen Chat (인터랙티브)

세 가지 상호작용 모드가 제공됩니다:

  • Auto – 도구 사용(검색, 코드 인터프리터)과 적응형 추론.
  • Thinking – 어려운 문제를 위한 깊은 사고 사슬.
  • Fast – 도구 호출 없이 즉시 답변.

6.2 Qwen 3.5‑Plus (Alibaba Cloud ModelStudio에서 호스팅)

고급 기능을 환경 변수로 활성화합니다:

export DASHSCOPE_API_KEY=your_key
export DASHSCOPE_MODEL=qwen3.5-plus   # optional override
# Enable reasoning chain‑of‑thought
export ENABLE_THINKING=true
# Enable web search & code interpreter
export ENABLE_SEARCH=true

간단한 Python 예시:

from openai import OpenAI
import os
client = OpenAI(api_key=os.getenv("DASHSCOPE_API_KEY"),
                base_url=os.getenv("DASHSCOPE_BASE_URL",
                                   "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"))
resp = client.chat.completions.create(
    model=os.getenv("DASHSCOPE_MODEL", "qwen3.5-plus"),
    messages=[{"role": "user", "content": "Introduce Qwen 3.5."}],
    extra_body={"enable_thinking": True, "enable_search": False},
    stream=True)
for chunk in resp:
    print(chunk.choices[0].delta.get("content", ""), end="")

같은 엔드포인트는 Qwen Code, Qwen Visual Agents, 및 vibe‑coding 경험도 지원합니다.

7. 시사점 및 향후 방향

  • 네이티브 멀티모달 추론: 트랜스포머 스택 초기에 비전을 결합함으로써 Qwen 3.5는 단일 패스에서 이미지, 비디오 및 텍스트를 추론할 수 있어 범용 AI 에이전트로 가는 결정적인 단계가 됩니다.
  • 파라미터 효율적 스케일링: 토큰당 전체 파라미터의 4–5 %만 활성화함으로써 대규모 모델도 추론 시 과도한 비용이 필요 없음을 보여줍니다.
  • 강화 학습 기반 에이전트: 비동기 RL 프레임워크는 장기, 다중 모달 환경에서 학습하는 에이전트를 훈련할 수 있게 하여 지속적이고 메모리 보강된 어시스턴트의 길을 엽니다.
  • 광범위한 접근성: 201개 언어와 250 k 토큰 어휘를 지원함으로써 비영어 개발자와 기업의 장벽을 낮춥니다.
  • 로드맵: Qwen 팀은 향후 기술 보고서를 예고했으며, 여기에는 더 큰 스케일 실험, 다양한 RL 환경, 외부 도구(예: 검색, 계획, 경제 인식)의 심층 통합이 상세히 다루어질 예정입니다.

8. 결론

Qwen 3.5‑397B‑A17B는 거대한 멀티모달 모델도 강력하면서 효율적일 수 있음을 증명합니다. 하이브리드 선형‑어텐션 + MoE 설계는 1 T 파라미터 모델에 필적하는 추론 비용으로 최첨단 정확도를 제공합니다. 오픈‑웨이트 릴리스, 방대한 벤치마크 스위트, 즉시 사용 가능한 클라우드 서비스는 차세대 AI 어시스턴트, 자율 에이전트 및 멀티모달 애플리케이션을 위한 매력적인 기반이 됩니다.

핵심 요약

  • 총 397 B 파라미터, 토큰당 17 B 활성 → Qwen 3‑Max‑Base보다 최대 19× 빠름.
  • 언어, 코딩, 추론 및 비전 작업에서 최첨단 결과.
  • 1 M 토큰 컨텍스트 윈도우로 장시간 비디오 및 문서 처리 가능.
  • 오픈‑웨이트 모델과 호스팅된 Qwen 3.5‑Plus를 통해 즉시 프로덕션에 활용 가능.

참고 문헌

  • Qwen AI 블로그 게시물 – Qwen 3.5: Towards Native Multimodal Agents (2026‑02‑14).
  • GitHub, Hugging Face, ModelScope에 있는 공식 모델 카드.
  • 벤치마크 스위트: MMLU‑Pro, C‑Eval, LiveCodeBench v6, MMMU‑Pro, VideoMME 등.

Sources