QwenLM/Qwen3.8-Flash-Next
Qwen3.8-Flash-Next is the foundation model developed by Qwen Team, Alibaba Group.
해결하는 문제
Qwen3.8-Flash-Next는 코딩 및 사무 업무에서 높은 성능을 유지하면서도 계산 효율성과 학습 안정성을 극대화하기 위해 설계된 멀티모달 Mixture-of-Experts (MoE) 모델입니다. 이 모델은 곧 출시될 Qwen4 시리즈의 초기 아키텍처 사전 시연으로, Qwen3.7-Plus와 비교해 훨씬 낮은 학습 및 추론 비용을 제공하는 하이브리드 아키텍처를 도입했습니다.
작동 방식
이 모델은 네 가지 핵심 영역에서 체계적인 업그레이드를 수행합니다:
- Attention: 하이브리드 GDN + QSA 아키텍처를 사용합니다. 게이트형 델타넷(GDN)은 효율적인 이력 압축을 처리하고, Qwen 스파스 어텐션(QSA)은 가벼운 인덱서를 사용해 마이크로 블록 수준에서 중요한 컨텍스트를 선택하여 긴 시퀀스의 비용을 줄입니다.
- Residual: 게이트형 리지듀얼(GR)을 구현합니다. 리지듀얼 스트림을 네 가지 브랜치로 확장하고, 동적 게이트를 사용해 정보 흐름을 제어하여 안정성을 향상시킵니다.
- Embedding: N-gram Embedding을 사용합니다. 지역적 컨텍스트를 활용해 계산 비용을 최소화하면서 모델 용량을 확장할 수 있으며, 이러한 테이블은 호스트 메모리로 오프로드하고 비동기적으로 프리페치할 수 있습니다.
- 최적화: 직교화 정확도와 특정 파라미터 분할에 최적화된 Muon 최적화기 사용하며, 재조정된 스케일링 법칙을 적용합니다.
대상 사용자
이 모델은 125B 파라미터(1토큰당 6B 활성화)의 고용량 모델을 비용 효율적으로 실행하고 학습하고자 하는 개발자 및 연구자, 그리고 Qwen4로의 아키텍처 변화를 분석하고자 하는 커뮤니티를 위한 것입니다.
주요 특징
- 극도의 효율성: Qwen3.7-Plus 대비 학습 비용이 약 1/9로 감소하면서도 코딩 및 사무 업무 성능은 향상되었습니다.
- 멀티모달 MoE: 멀티모달 기능과 Mixture-of-Experts 아키텍처를 결합했습니다.
- Hugging Face 및 ModelScope 지원: 가중치는 두 플랫폼 모두에서 제공되어 쉽게 통합할 수 있습니다.
- 광범위한 배포 지원: SGLang, vLLM, llama.cpp, MLX와 호환되어 고성능 추론이 가능합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트