Qwen 3.8 27B 릴리스 노트
Qwen 3.8 27B는 컴팩트한 27B 밀도 모델에서 선도적인 코딩 및 에이전트 기능을 제공합니다
Qwen 3.8 27B는 Qwen 3.5의 아키텍처 기반으로 구축된, 지금까지 Qwen 오픈 모델 가족에서 가장 강력한 세대입니다. 코딩, 전문 연구, 장기적 목표를 가진 에이전트 작업에서 큰 성능 향상을 제공하면서도, 배포에 유리한 크기를 유지합니다. 특히 이미지와 시간 단위 영상까지 이해할 수 있는 네이티브 비전-언어 모델입니다.
핵심 기술 사양
Qwen 3.8 27B는 통합된 비전 인코더를 갖춘 인과 언어 모델(Causal Language Model)입니다. 비밀집 모델(MoE 아님)로, 다음과 같은 아키텍처를 가지고 있습니다:
- 파라미터 수: 270억
- 히든 차원: 5120
- 레이어 수: 64
- 컨텍스트 길이: 262,144 토큰(기본), RoPE 스케일링을 통해 최대 1,000,000 토큰까지 확장 가능 (예: YaRN)
- 아키텍처 레이아웃: 16 × (3 × (게이트드 델타넷 → FFN) → 1 × (게이트드 어텐션 → FFN))
- MTP (다중 토큰 예측): 추론 효율성을 높이기 위해 여러 단계로 훈련됨
주요 기능 개선사항
유연한 사고 제어
Qwen 3.8은 기본적으로 활성화된 "사고 모드"를 도입했습니다. 이는 최종 답변을 생성하기 전에 내부 추론 흐름(</tool_call> 태그로 표시)을 생성할 수 있게 합니다. 사용자는 다음을 통해 이 동작을 제어할 수 있습니다:
reasoning_effort: 세 가지 수준으로 추론 깊이를 조절합니다:xhigh(기본, 복잡한 분석용),medium(균형),low(속도/비용 최적화용)preserve_thinking: 기본적으로 활성화되어 있어 이전 메시지의 추론 블록을 유지하여 맥락 일관성을 보장하고 KV 캐시 활용도를 높입니다.- 인스트럭트 모드: 직접 응답을 원할 경우 사고 모드를 완전히 비활성화할 수 있습니다.
네이티브 다중 모달 지능
이 모델은 이미지 및 영상 이해를 네이티브로 지원하며, STEM 다이어그램, 문서, 시간 단위 영상까지 포함합니다. OSWorld, WebArena, AndroidWorld와 같은 "컴퓨터 사용" 시나리오에서 높은 전문성을 보여줍니다.
벤치마크 성능
Qwen 3.8 27B는 Qwen 3.6 27B보다 크게 향상되었으며, Opus 4.6 Max와 같은 더 큰 선도 모델과 경쟁 수준의 성능을 보입니다.
텍스트 및 코딩 성능
| 벤치마크 | Qwen 3.8 27B | Qwen 3.6 27B | Opus 4.6 Max |
|---|---|---|---|
| SWE-bench Pro (에이전트 코딩) | 61.7 | 53.5 | 53.4 |
| QwenSWEBench (소프트웨어 엔지니어링) | 79.0 | 49.3 | 63.8 |
| CoWorkBench (사무 업무) | 70.7 | 61.0 | 68.2 |
| LiveCodeBench v6 (경쟁 코딩) | 90.3 | 83.9 | 88.8 |
| IFBench (명령어 따르기) | 79.5 | 69.1 | 62.5 |
비전-언어(VL) 성능
| 벤치마크 | Qwen 3.8 27B | Qwen 3.6 27B | Opus 4.6 Max |
|---|---|---|---|
| OSWorld-Verified (컴퓨터 사용) | 84.3 | 63.9 | 72.7 |
| WebArena-Verified (브라우저 사용) | 64.8 | 48.8 | -- |
| AndroidWorld (모바일 사용) | 81.9 | 70.3 | 62.0 |
| MathVision (시각적 수학) | 94.6 (CI 포함) | 85.1 | 65.5 |
배포 및 서빙 최적화 팁
추천 프레임워크
생산 환경에서는 Qwen 팀이 전용 서빙 엔진 사용을 권장합니다:
- SGLang, vLLM, 또는 TokenSpeed.
- FP8 양자화: 공개된 FP8 양자화된 가중치는 블록 크기 128의 세밀한 양자화를 사용하여 원본 모델과 거의 동일한 성능을 제공합니다.
샘플링 파라미터
- 사고 모드:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0 - 인스트럭트 모드:
temperature=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
긴 컨텍스트 처리
100만 토큰까지 컨텍스트를 확장하려면 config.json의 rope_parameters를 수정하여 rope_type: "yarn"과 factor: 4.0을 사용해야 합니다. 팀은 정적 YaRN이 짧은 텍스트에서 성능에 영향을 줄 수 있다고 경고하며, 일반적인 애플리케이션 길이에 따라 factor를 조정할 것을 제안합니다.
커뮤니티 인사이트 및 관찰
Hacker News에서의 커뮤니티 피드백은 여러 실용적인 배포 경험을 강조합니다:
- 하드웨어 성능: RTX 3090과 M5 Max 맥북 등 다양한 하드웨어에서 성공적으로 배포된 사례가 보고되었습니다. 한 사용자는 RTX 5090에서
ninfer엔진을 사용해 초당 약 138토큰의 속도를 달성했다고 밝혔습니다. - 추론 동작: 일부 사용자는
xhigh추론 모드가 "과도한 사고" 또는 "지나친 복잡한 코드"를 유도할 수 있다고 관찰하며, 간단한 작업에는medium또는low수준이 더 적합할 수 있다고 제안했습니다. - MoE와의 비교: 일부 개발자는 Mixture-of-Experts(MoE) 모델(예: 35B A3B)이 저사양 하드웨어(예: M1 Max)에서 더 효율적이라고 선호하며, 27B 밀도 모델이 메모리 소비가 크다고 지적했습니다.
- 실제 활용성: 여러 사용자는 모델이 복잡한 코딩 작업과 SVG 생성에서 실제로 "Opus 4.5/4.6"처럼 느껴진다고 보고했습니다.
"이미지와 제가 만들고 싶은 것에 대한 일반적인 개요를 주었고, 모델이 처음부터 끝까지 전체 시스템을 구축해냈습니다." — @swalsh
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch