Qwen3.8-2.4T-A95B 릴리스 노트

Qwen3.8-2.4T-A95B는 오픈 릴리스에 Qwen-Max급 성능을 가져옵니다

Qwen3.8-2.4T-A95B는 Qwen 오픈 모델 제품군 중 가장 뛰어난 성능을 가진 세대로, 코딩, 전문 연구 및 장기적 에이전트 작업에서 상당한 발전을 제공합니다. Qwen3.5의 아키텍처 기반 위에 구축된 이 모델은 높은 신뢰성과 더 강력한 자율적 계획 능력을 갖추고 복잡한 다단계 작업을 처리하도록 설계되었습니다.

모델 아키텍처 및 사양

Qwen3.8-2.4T-A95B는 전체 파라미터 수와 추론 효율성 사이의 균형을 맞추기 위해 Mixture of Experts (MoE) 아키텍처를 사용하는 Causal Language Model입니다.

핵심 기술 사양

  • Total Parameters: 2.4 Trillion
  • Activated Parameters: 95 Billion
  • Number of Layers: 92
  • Hidden Dimension: 8192
  • Mixture of Experts: 총 512개의 전문가(experts) 중 토큰당 10개의 라우팅된 전문가와 1개의 공유 전문가가 활성화됩니다.
  • Expert Intermediate Dimension: 2048
  • Context Length: 기본 262,144 토큰, 최대 1,010,000 토큰까지 확장 가능.
  • Vocabulary Size: 248,320 (padded).

아키텍처 레이아웃

이 모델은 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))의 숨겨진 레이아웃을 채택합니다. Gated DeltaNet에서는 V를 위한 128개의 선형 어텐션 헤드와 QK를 위한 16개의 헤드를 특징으로 하며, Gated Attention에서는 Q를 위한 64개, KV를 위한 4개의 어텐션 헤드를 특징으로 합니다.

성능 벤치마크

Qwen3.8-Max (이 모델을 기반으로 한 공식 버전)는 Claude Opus 4.8, Fable 5, GPT-5.6 Sol과 같은 프런티어 모델들과 경쟁력 있는 성능을 보여줍니다.

코딩 및 에이전트 성능

Qwen3.8-Max는 Qwen3.7-Max에 비해, 특히 소프트웨어 엔지니어링 벤치마크에서 상당한 개선을 보여줍니다:

  • Terminal Bench 2.1: 86.6 (vs. Qwen3.7-Max의 74.5)
  • FrontierSWE: 73.5 (vs. Qwen3.7-Max의 40.7)
  • PaperBench: 93.0 (GPT-5.6 Sol의 90.5를 앞지르며 그룹 내 선두)
  • AndroidBench: 75.1 (vs. Qwen3.7-Max의 56.5)

일반 성능

  • GPQA Diamond: 92.6으로, Fable 5와 대등하며 Opus 4.8 (92.0)을 능가합니다.
  • IFBench: 82.8로, GPT-5.6 Sol (72.7) 및 Fable 5 (63.5)를 능가합니다.
  • MRCR v2 256K (8-needle): 92.9로, 강력한 장기 컨텍스트 검색 능력을 보여줍니다.

배포 및 API 사용

서빙 프레임워크

Qwen3.8은 여러 고처리량 추론 엔진과 호환됩니다:

  • SGLang
  • vLLM
  • TokenSpeed

API 설정 및 추론 제어

Qwen3.8-2.4T-A95B는 모든 상호작용에 "thinking mode"가 필요한 텍스트 전용 모델입니다. 모든 응답은 <think> 태그로 둘러싸인 추론 과정으로 시작됩니다.

사용자는 reasoning_effort 파라미터를 통해 추론의 깊이를 제어할 수 있습니다:

  • xhigh (Default): 철저한 분석이 필요한 복잡한 작업용.
  • medium: 정확도와 속도 사이의 균형.
  • low: 속도와 비용에 최적화.

권장 샘플링 파라미터

최적의 결과를 얻으려면 다음 샘플링 설정을 권장합니다:

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0.

커뮤니티 인사이트 및 기술적 고려 사항

커뮤니티 논의에서는 오픈 웨이트 버전과 관리형 Qwen3.8-Max 서비스 간의 몇 가지 중요한 트레이드오프를 강조합니다.

하드웨어 요구 사항 및 양자화

2.4T 파라미터 수로 인해, 전체 BF16 모델의 크기는 약 4.9TB로 추정됩니다. 커뮤니티 멤버들은 양자화 없이 이 모델을 서빙하는 것이 대부분의 사용자에게 지나치게 비싸다는 점을 언급했습니다.

"1bit quant 모델은 놀라운 397GB입니다... 이것은 말 그대로 일반인이 살 수 있는 머신에 Opus 4.5 성능 수준을 담아냅니다."

기능적 차이

사용자들은 오픈 웨이트 버전이 관리형 Qwen3.8-Max 버전에서 제공되는 다음과 같은 여러 기능을 결여하고 있음을 지적했습니다:

  • Vision Support: 오픈 웨이트 모델은 텍스트 전용입니다.
  • Context Window: 오픈 웨이트 버전은 250k 토큰으로 제한되지만, 관리형 버전은 기본적으로 1M 토큰을 지원합니다.
  • Non-thinking support: 관리형 버전은 필수적인 추론 단계 없이 응답할 수 있습니다.

라이선스

이 모델은 내부용 또는 연간 매출이 5,000만 달러 미만인 기업에 대해 무료입니다. 이 임계값을 초과하는 기업, 특히 코딩이나 생산성 에이전트를 대상으로 하는 서비스의 경우 제한 사항이 적용됩니다.

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch