Qwen 3.8-Flash-Next 출시

Qwen 3.8-Flash-Next는 차세대 Qwen4 아키텍처를 도입합니다

Alibaba는 멀티모달 Mixture-of-Experts (MoE) 모델인 Qwen 3.8-Flash-Next를 출시합니다. 이번 출시는 향후 출시될 Qwen4 모델 제품군에 통합될 아키텍처의 발전을 미리 보여주는 초기 프리뷰 역할을 하며, 커뮤니티가 전체 제품군 출시를 준비할 수 있도록 합니다.

모델 사양 및 가용성

Qwen 3.8-Flash-Next는 2026년 8월 26일 15:00 UTC에 출시될 예정입니다. 이번 출시에는 모델의 두 가지 주요 버전이 포함됩니다:

  • Qwen/Qwen3.8-Flash-Next: 표준 오픈 모델.
  • Qwen/Qwen3.8-Flash-Next-FP8: 효율성 향상을 위한 양자화 버전.

공식 ModelScope 페이지의 본문에는 파라미터 수가 명시적으로 나열되어 있지 않지만, 커뮤니티 논의에 따르면 총 125B 파라미터 중 6B 활성 파라미터(125B a6B)로 구성된 것으로 나타납니다.

로컬 배포 및 하드웨어 요구 사항

Qwen 3.8-Flash-Next의 MoE 아키텍처는 고메모리 소비자용 하드웨어를 사용하는 사용자들에게 매력적인 대상입니다. MoE 모델은 추론 과정에서 전체 파라미터의 일부만 활성화하기 때문에, 모델 가중치를 유지할 수 있는 충분한 RAM/VRAM이 있다면 로컬 머신에서 사용 가능한 속도를 달성할 수 있습니다.

커뮤니티 구성원들은 잠재적 배포를 위한 몇 가지 하드웨어 구성을 강조했습니다:

  • High-RAM 시스템: 128GB RAM을 사용하는 사용자(Strix Halo 또는 Mac Studio/M-series Max 칩 사용자와 같이)는 큰 컨텍스트 윈도우를 가진 4-bit 양자화 모델이 효율적으로 작동하고 적합할 것으로 예상합니다.
  • Hybrid Memory Layouts: 일부 사용자는 밀집 추론 레이어를 GPU에, 전문가(experts) 레이어를 CPU에 배치하여 MoE 모델을 실행하는 데 성공했다고 보고했습니다. 이는 이전 80B-a3B 모델에서 초당 최대 40토큰의 속도를 달성했습니다.
  • Inference Optimizations: 이 모델과 FreeToken과 같은 추론 엔진의 결합에 대해 상당한 관심이 있습니다. FreeToken은 MoE 아키텍처를 위해 CPU/RAM과 GPU/VRAM 간의 작업 분배를 최적화하는 것을 목표로 합니다.

커뮤니티 관점 및 시장 포지셔닝

개발자들과 애호가들은 Qwen 3.8-Flash-Next가 다른 고효율 모델, 특히 DeepSeek v4 Flash와 어떻게 비교되는지 모니터링하고 있습니다. 아키텍처 개선 사항의 조기 출시는 전체 Qwen4 출시 전에 커뮤니티에 프리뷰를 제공하기 위한 전략적 움직임으로 간주됩니다.

일부 개발자들은 OpenRouter와 같은 제第三方(third-party) 제공업체를 통해 Qwen 모델에 접근할 때의 안정성과 용량 문제에 대해 언급했습니다. 이는 모델 아키텍처는 인상적이지만, 신뢰할 수 있는 API 접근을 위한 인프라가 일부 사용자에게는 여전히 문제점으로 남아 있음을 시사합니다.

"I enjoy the Qwen models a lot, but building things on top of them with OpenRouter has been painful... many Qwen models have almost no capacity or is so flaky you literally have to just litter your code with a blacklist/whitelist of providers."

전반적으로, 이번 출시는 오픈 웨이트(open-weights) 모델 분야에서 Alibaba의 지속적이고 공격적인 행보를를 보여주는 신호로 간주되며, 코딩 및 기술적 작업에 대한 독리적(proprietary) 모델의 지배력을 잠재적으로 위협할 수 있습니다.

Sources

관련