Qwen3.8-Flash-Next 릴리스 노트 / 새로운 기능
Qwen3.8-Flash-Next는 차세대 Qwen4 제품군을 위한 아키텍처 프리뷰 역할을 하는 멀티모달 Mixture-of-Experts (MoE) 모델입니다. 이 모델은 하이브리드 Gated DeltaNet (GDN) 및 Qwen Sparse Attention (QSA) 설계를 도입하여 계산 효율성과 모델 용량을 최적화하며, Qwen3.7-Plus에 필요한 비용의 약 1/9 수준으로 훈련 비용을 절감하는 동시에 코딩 및 사무 생산성 작업에서 탁월한 성능을 제공합니다.
모델 아키텍처 및 기술 혁신
Qwen3.8-Flash-Next는 어텐션(attention), 잔차 스트림(residual streams), 임베딩(embeddings), 최적화(optimization)의 네 가지 주요 기술적 차원에서 체계적인 업그레이드를 구현합니다.
하이브리드 어텐션: GDN 및 QSA
메모리 효율성과 정밀한 검색 사이의 균형을 맞추기 위해, 이 모델은 네 개의 레이어 중 세 개가 Gated DeltaNet (GDN)을 사용하여 과거 정보를 고정된 크기의 상태로 압축하는 하이브리드 아키텍처를 사용합니다. 나머지 한 개의 레이어는 Qwen Sparse Attention (QSA)으로 강화된 글로벌 어텐션을 채택합니다.
QSA는 경량 인덱서를 사용하여 시퀀스를 마이크로 블록으로 집계함으로써 긴 시퀀스 계산의 오버헤드를 줄입니다. 블록 수준에서 중요도를 추정하고 어텐션을 위한 관련 영역을 선택하여 어텐션 비용과 인덱싱 오버헤드를 모두 줄입니다. 100만 토큰 컨텍스트 길이에서 QSA의 어텐션 커널은 prefill 단계에서 최대 7.6배, decode 단계에서 4.9배의 속도 향상을 달성합니다.
Gated Residual (GR)
심층 네트워크에서 초기 특징이 희석되는 것을 방지하기 위해, Gated Residual (GR)은 전통적인 단일 잔차 스트림을 네 개의 병렬 브랜치로 확장합니다. 동적이고 요소별(element-wise) 게이트가 이러한 브랜치들 사이의 정보 읽기 및 쓰기를 제어하여 레이어 간 정보 흐름을 강화하고 훈련 안정성을 향상시킵니다. 또한 잔차 상태는 메모리 액세스 오버헤드를 더욱 줄이기 위해 FP8 저장을 지원합니다.
N-gram Embedding
토큰당 계산량을 늘리지 않고 모델 용량을 확장하기 위해, Qwen3.8-Flash-Next는 N-gram Embedding을 도입합니다. 이 방법은 현재 토큰과 여러 이전 토큰을 기반으로 룩업을 수행하여 일반적인 구절과 로컬 패턴을 표현합니다. 모델에는 51B N-gram 임베딩 파라미터가 포함되어 있으며, 이는 호스트 메모리로 오프로드하거나 비동기적으로 프리페치(prefetched)할 수 있어 GPU 메모리를 영구적으로 점유하지 않습니다.
Muon을 통한 최적화
이 모델은 직교화 정확도와 융합된 파라미터 행렬의 분할을 위해 특별히 정제된 Muon 옵티마이저를 사용하여 훈련됩니다. Muon은 2차원 선형 맵(Attention, GDN, 및 MoE Experts)에 적용되며, AdamW는 임베딩, MoE 라우터, 그리고 GR의 저차원(low-rank) 파라미터에 유지됩니다. 이러한 공동 설계는 더 큰 학습률과 배치 크기를 가능하게 하여 수렴 효율성을 향상시킵니다.
모델 사양 및 기능
Qwen3.8-Flash-Next는 125B 파라미터의 메인 모델과 추가 51B N-gram 임베딩을 특징으로 하며, 토큰당 6B 파라미터를 활성화합니다.
컨텍스트 윈도우 및 성능
- 컨텍스트 지원: 기본적으로 262,144 토큰을 지원하며, YaRN을 통해 1,000,000 토큰까지 확장 가능합니다.
- 효율성: 90% 프리픽스 캐시 히트율을 가진 서빙 시나리오에서, 1M 토큰 시 Qwen3.7-Plus보다 8.6배 높은 prefill 처리량을 달성합니다.
- 가격: 프로덕션 버전(Qwen3.8-Flash)의 가격은 입력 토큰 100만 개당 0.16 USD, 출력 토큰 100만 개당 0.47 USD입니다.
벤치마크
기본 모델 비교에서, Qwen3.8-Flash-Next-Base는 MMLU-Pro, SuperGPQA, BBH, GSM8K, EvalPlus, SWEBench-Pretrain, MGSM, 및 MMMLU를 포함한 14개 벤치마크 중 8개에서 Qwen3.8-27B-Base 및 Qwen3.7-Plus-Base를 능가했습니다.
에이전트 및 코딩 작업에서 모델은 상당한 이득을 보여줍니다:
- DeepSWE 1.1: 58.7 (Qwen3.7-Plus의 16.5 대비).
- SWE-bench Pro: 62.5 (Qwen3.7-Plus의 55.8 대비).
- CoWorkBench: 73.9 (Qwen3.7-Plus의 65.1 대비).
- LiveCodeBench v6: 91.9.
멀티모달 및 비전-언어 성능
Qwen3.8-Flash-Next는 멀티모달 에이전트 지능 및 일반 인지 능력에서 강력한 성능을을 보여줍니다:
- Multimodal Tool Use (ClawEval-MM): 64.4 Pass@3.
- Mobile Use (AndroidWorld): 84.5.
- Computer Use (OSWorld 2.0): 19.4 Binary / 52.3 Partial.
- Long Video Understanding (LVBench): 46.6.
- Visual Math (MathVision): 95.7 with CI.
통합 및 가용성
가중치는 Hugging Face와 ModelScope에서 사용할 수 있습니다. 모델은 QwenCloud에서 qwen3.8-flash라는 이름으로 제공되며, OpenAI-호환 Chat Completions 및 Responses API를 지원하며, Claude Code와 같은 도구와의 직접적인 통합을 위한 Anthropic-호환 인터페이스도 지원합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch