Qwen3.8-Flash-Next 릴리스 노트: Qwen4 아키텍처의 사전 보기
Qwen3.8-Flash-Next는 주의(attention), 잔차 흐름(residual streams), 임베딩(embeddings), 최적화 측면에서 체계적인 아키텍처 개선을 도입한 다중모달 Mixture-of-Experts (MoE) 모델입니다. Qwen4 아키텍처의 초기 사전 보기로 설계되었으며, Qwen3.7-Plus보다 코딩 및 사무 업무에서 뛰어난 성능을 달성하면서도 훈련 비용은 1/9에 불과합니다.
아키텍처 혁신
Qwen3.8-Flash-Next는 계산 효율성과 모델 용량을 향상시키기 위해 네 가지 주요 기술적 업그레이드를 구현합니다.
하이브리드 주의: GDN과 QSA
메모리 효율성과 정밀한 검색 간의 균형을 맞추기 위해, 모델은 네 층 중 세 층이 Gated DeltaNet (GDN) 을 사용하여 역사적 정보를 고정 크기의 상태로 압축하는 하이브리드 아키텍처를 채택합니다. 나머지 층은 Qwen Sparse Attention (QSA) 로 강화된 글로벌 주의를 사용합니다.
QSA는 가벼운 인덱서를 사용하여 시퀀스를 마이크로 블록으로 집계함으로써 긴 시퀀스 계산의 오버헤드를 줄입니다. 토큰 단위가 아니라 블록 단위에서 중요도를 추정함으로써 인덱싱 비용을 최소화합니다. 1M 토큰의 컨텍스트 길이에서 QSA는 프리필(pre-fill) 시 최대 7.6배, 디코딩 시 4.9배의 속도 향상을 달성합니다. 90%의 접두사 캐시 히트율 상황에서는 Qwen3.7-Plus보다 프리필 처리량이 8.6배 높습니다.
게이트 잔차(GR) 흐름
깊은 네트워크에서 초기 층의 특징이 희석되는 것을 방지하기 위해, Gated Residual (GR) 은 기존의 단일 잔차 흐름을 네 개의 병렬 브랜치로 확장합니다. 동적이고 요소별 게이트는 정보를 이 브랜치들에서 읽고 쓰는 방식을 제어합니다.
이 설계는 초기 주의 층에서 깊은 층까지 장거리 경로를 유지할 수 있게 해줍니다. 또한 GR 메커니즘은 활성화 이상치를 억제하여 훈련 안정성을 향상시키며, FP8 저장을 지원하여 메모리 접근 오버헤드를 줄입니다.
확장 가능한 용량을 위한 N-gram 임베딩
Qwen3.8-Flash-Next는 현재 토큰과 이전 토큰들로 구성된 로컬 컨텍스트를 기반으로 검색을 수행하는 N-gram 임베딩을 도입합니다. 이는 토큰 단위가 아니라 로컬 패턴을 기억하는 기능을 추가하여, 토큰당 계산 비용이 거의 증가하지 않으면서도 모델 용량을 증가시킵니다.
모델은 125B의 주 모델 파라미터 외에 51B의 N-gram 임베딩 파라미터를 포함합니다. GPU 메모리 과부하를 방지하기 위해 이 파라미터들은 호스트 메모리에 저장하고 모델 계산 중 비동기적으로 프리페치할 수 있습니다.
Muon을 통한 최적화
모델은 Muon 최적화기를 사용하여 훈련되며, 이는 직교화 정확도와 융합된 파라미터 행렬의 분할에 특화되어 있습니다. Muon은 이차원 선형 맵(Attention, GDN, MoE 전문가)에 적용되며, 임베딩, MoE 라우터, GR 저랭크 파라미터에는 AdamW가 유지됩니다.
주요 최적화 발견 사항:
- 스케일링 법칙 재적합: 새로운 아키텍처는 더 큰 학습률과 배치 크기를 가능하게 합니다.
- 배치 크기 워밍업: 목표 배치 크기로 바로 시작하는 것이 점진적 워밍업보다 더 효율적이며, 최적화 스텝 수를 18.8% 감소시킵니다.
모델 사양 및 성능
Qwen3.8-Flash-Next는 125B 파라미터의 주 모델을 갖추고 있으며, 토큰당 활성화되는 파라미터는 6B입니다. 기본적으로 262,144 토큰의 컨텍스트 창을 지원하며, YaRN을 통해 1,000,000 토큰까지 확장 가능합니다.
벤치마크
언어 및 코딩 작업에서 Qwen3.8-Flash-Next는 여러 경쟁 모델과 이전 버전을 능가합니다:
| 벤치마크 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek-V4-Flash |
|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 |
시각-언어 작업에서는 특히 AndroidWorld (84.5) 와 OSWorld 2.0 (52.3 partial) 에서 강력한 에이전트 기능을 보여주며, Qwen3.7-Plus보다 훨씬 뛰어난 성능을 기록합니다.
배포 및 가격
Qwen3.8-Flash-Next는 허깅페이스와 ModelScope에서 오픈웨이트 모델로 제공됩니다. 생산용 버전인 Qwen3.8-Flash 는 QwenCloud를 통해 제공되며, 다음과 같은 가격 책정이 적용됩니다:
- 입력: 100만 토큰당 0.16 USD
- 출력: 100만 토큰당 0.47 USD
커뮤니티 인사이트 및 기술 논의
커뮤니티 피드백은 새로운 아키텍처의 효율성 향상과 하드웨어 요구 사항을 모두 강조합니다:
하드웨어 제약: 사용자들은 51B의 N-gram 임베딩 파라미터가 메모리 사용량을 크게 증가시킨다고 지적했습니다. 6B의 활성 파라미터가 메모리 대역폭을 도와주지만, 전체 크기가 128GB 미만의 RAM을 가진 사용자에게는 도전적입니다. 한 사용자는 다음과 같이 언급했습니다:
"50B ngram 사이드카는 이를 불가능하게 만듭니다... 새로운 ngram 아키텍처는 32-64GB RAM 이상을 갖추지 못한 일반 사용자에게 거의 사용 불가능하게 만듭니다."
로컬 실행: 초기 사용자들은 Ryzen 395 / Strix Halo 하드웨어에서 성공적으로 실행한 사례를 보고했으며, 약 22 토큰/초의 속도를 달성했습니다. 일부 사용자는 로컬 지원을 가능하게 하기 위해
llama.cpp의 예비 브랜치를 구현했습니다.성능 대 비용: 복잡한 에이전트 작업(예: 코드 아카이브 및 리그레션 수정)을 매우 낮은 비용으로 처리할 수 있다는 점이 주요 장점으로 언급되었습니다. 한 사용자는 복잡한 머지와 수정 작업이 단지 0.45달러로 완료되었다고 보고했습니다.
양자화: 다양한 양자화 수준(예: IQ4_XS)의 효과에 대한 논의가 지속되고 있으며, 일부 사용자는 매우 압축된 양자화를 사용할 경우 밀도 있는 Qwen3.8-27B 모델보다 성능 저하가 발생하는 것을 관찰했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch