Qwen3.8-Max 출시: 2.4T‑파라미터 모델, 다음 주 오픈 웨이트, 그리고 광범위한 자율 기능
Qwen3.8‑Max 개요
Qwen3.8‑Max는 현재까지 Qwen 가족 중에서 가장 성능이 뛰어난 모델로, 2.4 조 파라미터(95 B 활성)로 확장되어 코딩, 업무, 연구, 장시간 작업 전반에 걸쳐 포괄적인 개선을 제공합니다. 이번 출시는 Qwen‑Max‑클래스 모델의 가중치가 처음으로 오픈 소스로 공개되는 사례이며, 오픈 가중치는 다음 주에 출시될 예정입니다.
코딩 기능
자율 자기 진화 하네스
Qwen3.8‑Max는 oh‑my‑cli 프로젝트를 처음부터 구축하도록 과제를 받았으며, 10일 이상 지속되는 자율 코딩 실행 동안 사용자 피드백, 커뮤니케이션 관행, 자체 테스트 결과를 지속적으로 반영하는 자기 진화 하네스를 구축했습니다. 2026년 7월 30일 기준으로 약 16일 동안 완전 자율적으로 운영한 결과, 저장소에는 265개의 커밋, 127개의 PR, 151개의 이슈가 축적되었습니다【...】.
하네스의 주요 요소는 실행 루프를 형성하는 이슈 상태 머신, 디스패처, 모니터, 워치독; 비정상 상태를 관련 이슈/PR로 라우팅하는 자체 테스트; 커뮤니케이션 경험과 피드백을 실행 가능한 작업으로 변환하는 다중 소스 진화입니다.
연구 논문 재현 및 개선
논문 “Unified Data Selection for LLM Reasoning” (arXiv:2605.22389)와 GPU 세트만 주어졌을 때, Qwen3.8‑Max는 약 5일 (~125시간) 동안 약 7,600줄의 코드를 작성하고, 33라운드의 GPU 학습을 수행하여 논문의 여섯 가지 주요 결과를 재현했습니다. 그 후 약 88시간 동안 자기 개선 연구 루프에 진입하여 네 라운드에 걸쳐 18개의 개선 아이디어를 테스트했습니다. 최종 방법—난이도 높은 결정 포인트(“nhighgate”) 세기—는 AIME24 벤치마크에서 논문의 기준 대비 +2.7점의 향상을 달성했습니다【...】.
24시간 대회에서 인간 팀 이기기
WWW2025 멀티모달 대화 의도 인식 챌린지(알리바바 클라우드의 Tianchi 플랫폼에서 개최)에서 526개의 인간 팀과 경쟁하며, Qwen3.8‑Max는 엄격한 24시간 제한 내에서 자율적으로 동작했습니다. BERT, MacBERT, RoBERTa를 미세 조정하고 앙상블하여 텍스트를 처리하고, 중국‑CLIP을 기반으로 한 Qwen2.5‑VL‑7B 비전‑언어 모델을 스크린샷에 사용한 뒤 가중 투표 시스템으로 융합하는 솔루션을 구축했습니다. 45번의 제출 동안 정확도는 0.60에서 0.853으로 상승하여 **526팀 중 458팀(전체의 87 %)**을 앞섰습니다【...】.
이 세 가지 사례는 Qwen3.8‑Max가 인간 개입 없이 며칠 동안 열린 목표에 집중하고, 자체 아이디어를 생성하여 작동 가능한 결과로 전환할 수 있음을 보여줍니다.
실제 업무 역량
실제 세계 RL 시스템 확장
Qwen3.8‑Max의 업무 능력은 RL 환경과 계산을 공동으로 확장함으로써 향상되었습니다. 세 가지 결합된 과제가 해결되었습니다:
독립적인 축을 따라 분리된 실제 환경을 지속적으로 확장—작업(단일 작업 → 다중 작업 → 다일), 작업 공간(다중 파일 → 계층적 → 복잡한 이질적 폴더), 하네스(카테고리, 버전, 기술)—따라서 환경 성장이 조합적으로 증가합니다.
실행 기반 검사, 텍스트/시각 출력에 대한 루브릭 조건 adjudication, 에이전트 기반 검사 등 이질적인 검증을 자동으로 확장 가능한 루브릭 아래에 내재화하는 보편적 보상 시스템.
작업, 난이도, 작업 공간, 하네스에 대한 분포를 유지하여 배치 간 그래디언트 분산을 억제하고 안정적인 RL 계산 확장을 유지하는 온라인 데이터 밸런서.
これらは幅、信頼できる報酬、安定性を提供し、実際の作業能力における測定可能な水平的向上をもたらします。
수백 가지 직업에 걸친 폭넓은 적용
스트레스 테스트 결과, Qwen3.8‑Max는 많은 고부가가치 직업에서 실제 워크플로우에 생산 품질 결과를 제공함을 보여주었습니다:
- 기업 컴플라이언스 변호사: 수백 개의 문서에서 1,284개의 관련 조항을 1시간 이내에 찾아냈으며, 이는 일반 패럴리걸 팀이 일주일 소요되는 것과 대비됩니다.
- UI/UX 디자이너: 디지털 뱅킹 앱 NOVA(8 화면)의 고충실도 인터랙티브 프로토타입을 한 번에 zero 라운드의 인간 수정으로 제작했으며, 기존의 3–5 라운드와 비교됩니다.
- 레스토랑 브랜드 창업자: 수백 개의 원재료 공급 브리프를 읽고 평균 칼로리 값과 원재료 출처가 표기된 완전한 26품목 메뉴를 한 번에 제작했으며, 식품 원가 비율을 **33.8 %**로 유지했습니다.
- 구조 엔지니어: 브라우저에서 30층 사무실 타워의 지진 구조 모델을 재구성했으며, 자연 주기, 기초 전단, 층간 변위 비율을 호버 시 확인할 수 있었는데, 이는 전문 소프트웨어에서 보통 일주일 이상 소요되는 작업입니다.
- 재활 치료사: 2D 종이 평가 양식을 자유롭게 회전 가능한 시각角과 층별 해부학적 오버레이가 있는 3D 인터랙티브 데모로 변환했으며, 이는 이전에 의료 애니메이션 스튜디오에 외주하여 2–4주와 수천 달러가 소요되던 작업입니다.
- 스포츠 데이터 분석가: 선수당 약 8,400개의 공격/수비 소유를 분석하여 바로 사용 가능한 전술 프로필과 코칭 보고서를 몇 분 내에 제작했으며, 이는 기존 분석 팀이 며칠 소요되는 것과 대비됩니다.
단일 세션에서 수익성 있는 엔드‑투‑엔드 양적 전략 구축
Dynamic Workflows 구축 능력 덕분에 Qwen3.8‑Max는 한 번의 대화로부터 엔드‑투‑엔드 양적 연구 루프를 만들 수 있습니다. 한 줄의 작업 설명으로부터 복잡한 동적 워크플로를 자율적으로 계획하고, 데이터 시스템을 구축하며, 기본 팩터를 구성하고, 다중 라운드 탐욕적 반복을 조율하면서 백테스트를 동적으로 분석하고 과정을 수정합니다. 또한 팩터 채굴을 병렬화하여: 여섯 개의 클래식 팩터 가족을 아우르는 여섯 줄의 설명으로부터 각각을 50개의 연구 방향으로 분해하고, 약 330개의 서브‑에이전트를 파견하여 약 6,000개의 백테스트를 완료하며, 실행 중 워크플로를 지속적으로 적응시킵니다. 선정된 팩터는 초과 샤페 비율이 0.64–1.48 범위이며, IC는 0.010에서 0.014 사이로 일관되게 양수입니다【...】.
장시간 작업 성능
자율 칩 설계 및 폐쇄 루프 최적화
Qwen3.8‑Max는 GCD/RSA 암호화 하드웨어 가속기의 전체 실리콘 설계 흐름을 독립적으로 수행했습니다. 최소 입력—작업 설명, stub RTL 작업 공간, 평가 스크립트—로부터 시작하여 완전히 자율적으로 RTL 편집, 시뮬레이션 디버깅, 합성 분석, 중복 위치 지정, 반복 데이터 경로 재구성을 관리했습니다. 단일 연속 실행에서 약 500턴과 71번의 평가를 13개의 주요 마일스톤에서 수행하여 합성 게이트 수를 8,298게이트에서 678게이트(물리 다이 면적 81 % 감소)로 줄였으며, 500 MHz에서 타이밍 클로저를 달성했습니다(+0.66 ns 슬랙)【...】.
주요 마일스톤은 다음과 같습니다:
- 알고리즘 재작성: 모듈러 divider → 반복 시프트‑뺄셈 (8,298 → 2,010 게이트, 턴 22).
- 중복 제거 및 비트폭 트리밍 (2,010 → 1,304 게이트, 턴 35–48).
- 레지스터 및 컨트롤 FSM 가지치기 (1,304 → 907 게이트, 턴 60–113).
- 모듈 융합 및 로직 공유 (907 → 765 게이트, 턴 170–252).
- 게이트‑레벨 정제 (765 → 678 게이트, 턴 443–500).
OpenROAD를 통한 물리 레이아웃 검증은 다이 크기가 106×106 µm²에서 46×46 µm²로 감소했으며, 와이어 길이는 33,369 µm에서 4,187 µm로 줄었고, 타이밍 클로저에 성공했습니다.
장기 운영에서의 지속적 학습 (전자상거래 벤치마크)
365일 전자상거래 운영 시뮬레이션 벤치마크에서 Qwen3.8‑Max는 ¥100,000의 초기 자본으로 12개 매장 유형, 60개 제품 카테고리, 거의 600개 공급업체, 7,000개 제품에 걸쳐 제품 선택, 공급망 협상, 재고, 동적 가격 책정, 반품 처리를 관리해야 했습니다. 공급업체 협상에서 지속적 학습을 보여주어 점진적인 가격 인하와 꾸준한 수익 증가를 이끌어냈으며, 이에 따라 협상 효율성이 시간이 지남에 따라 확장되었습니다. 또한 이 경험을 유사한 제품에 일반화했으며, 다른 모델은 정체되었습니다.
숨겨진 위험(공급업체 매트에 내장된 152개의 사기성 상인)과 계절적 수요 변동에 맞서 Qwen3.8‑Max는 초기에 대규모 투자를 하여 자산 성장 곡선을 가속화하고 연말 주요 프로모션 기간 동안 순이익이 ¥100,000을 초과하도록 했으며—이는 2위인 GLM 5.2의 거의 2.4배에 해당합니다.最終的に、総バランスの最高値は**¥416,252**(4.16倍のリターン)に達し、GLM 5.2を**38 %上回り、以前のフラッグシップであるQwen3.7‑Maxに比べて152 %**の改善となりました【...】。
멀티모달 에이전트 및 시각 피드백 루프
Qwen3.8‑Max는 시각을 계획, 실행, 검증, 반복의 네이티브 피드백 루프로 취급합니다. 시각 콘텐츠를 이해하고 생성하며, 자신의 중간 결과를 검사하고 이탈(예: 잘못된 방향을 향한 텔레비전, 잘못 정렬된 인터페이스)을 감지하여 계획을 자율적으로 수정하고 출력을 교정할 수 있습니다.
이 기능은 코딩(효율적이고 확장 가능한 lourde 작업)과 GUI 작업(인간이 볼 수 있고 만질 수 있는 영역에 도달)을 결합하여 실제 실행 중인 애플리케이션에 대한 검증을 가능하게 하는 하이브리드 에이전트 행동을 가능하게 합니다.
이를 측정하기 위해 RecreationBench 벤치마크는 데스크톱 Ubuntu/macOS/Windows, 모바일 Android, 웹 등 다섯 플랫폼을 포함합니다. 모델은 소스 코드나 인터넷 접근 없이 실제 실행 중인 애플리케이션을 블랙 박스로만 관찰하고, 반복적인 코딩과 인터랙티브 피드백을 통해 전체 애플리케이션을 처음부터 다시 구축해야 합니다. Qwen3.8‑Max는 이 벤치마크에서 이미 하이브리드 에이전트 기능의 선두 수준을 보여주고 있습니다【...】.
더 쉬운 통합을 위해 Qwen‑MM‑Plugins는 이미지 및 비디오 처리, 멀티모달 메모리, 동적 해상도 지원, 시각 도구 사용, 비디오 편집, Blender, CAD와 같은 작업에 특화된 기능을 제공하는 하네스 확장 라이브러리를 제공합니다. 기존 에이전트 하네스는 이를 확장하여 보다 자연스럽게 멀티모달 네이티브 시스템으로 만들 수 있습니다.
사용자 피드백 및 커뮤니티 반응
Hacker News 토론에서의 댓글에서는 다음과 같은 점이 강조되었습니다:
- 다음 주에 Qwen3.8‑27B 오픈 가중치 출시가 발표되었으며, 이는 중요한 뉴스로 간주되었으며, 한 댓글에서는 "여기서 진짜 뉴스"라고 언급했습니다【...】.
- 일부 사용자는 Qwen3.8‑Max‑Preview가 이미 알리바바의 Token Plan, Qoder, QoderWork에서 7월 19일에 데뷔했으며, 8월 3일 발표가 추가로 무엇을 제공하는지 의문을 제기했습니다【...】.
- 비용과 효율성에 대한 궁금증이 제기되었습니다: 모델은
reasoning_effort파라미터(xhigh,medium,low)를 지원하여 reasoning 깊이를 조절하고 비용을 통제하며, 대안보다 znacz하게 저렴해지기를 기대하고 있습니다【...】. - 몇 명의 댓글 작성자는 modeste 하드웨어에서 27B 모델을 로컬로 실행하는 데 어려움을 겪었으며, GPU 메모리 제약을 지적했습니다【...】.
- 토큰 및 reasoning 효율성에 대한 질문이 제기되었으며, 벤치마크에서의 토큰 사용량 데이터 제공을 요청했습니다【...】.
- 모델의 시각 기능은 칭찬을 받았으나, 시각 웹 개발 작업에 사용할 때 타임아웃 문제가 발생한다는 의견도 있었습니다【...】.
- 토론에서는 더 넓은 함의가 다뤄졌습니다: 오픈 가중치 모델 금지의 창구가 잠재적으로 좁아질 가능성, 모델의 증류 출력에서 가능한 서구 편향, 그리고 더 가벼운 로컬 사용을 위해 언어별 변형으로 모델을 축소할 수 있는지 여부【...】.
- 여러 사용자는 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw와 같은 에이전트 프레임워크와 Qwen3.8‑Max를 통합하는 것에 대한 흥분을 표현하며, 예시 구성 스니펫을 공유했습니다【...】.
가용성 및 사용법
Qwen3.8‑Max는 QwenCloud에서 https://www.qwencloud.com/ 를 통해 이용 가능하며, 모델 가중치는 다음 주에 Hugging Face와 ModelScope에서 오픈 소스로 공개될 예정입니다.
API 사용법
공식 API는 비용과 깊이를 트레이드오프하는 reasoning_effort 인수를 지원합니다:
xhigh(기본값): 철저한 분석이 필요한 복잡한 작업용medium: 정확도와 속도의 균형low: 속도와 비용 최적화
preserve_thinking은 최상의 out‑of‑the‑box 경험을 위해 기본적으로 활성화됩니다.
OpenAI‑호환 클라이언트를 사용한 예시 호출:
from openai import OpenAI
import os
api_key = os.environ.get("DASHSCOPE_API_KEY
if not api_key:
raise ValueError("DASHSCOPE_API_KEY is required. Set it via: export DASHSCOPE_API_KEY='your-api-key'
)
client = OpenAI(
api_key=api_key,
base_url=os.environ.get(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
model="qwen3.8-max",
messages=messages,
extra_body={
"enable_thinking": True,
# "preserve_thinking": True,
},
reasoning_effort="xhigh",
stream=True,
)
# ... process streaming chunks for reasoning_content and answer_content
자세한 내용은 API 문서를 참조하세요.
코딩 어시스턴트와의 통합
- Claude Code:
ANTHROPIC_MODEL="qwen3.8-max"를 설정하고ANTHROPIC_BASE_URL을 QwenCloud 호환 엔드포인트로 지정합니다. - Codex:
~/.codex/model-catalog.local.json에slug: "qwen3.8-max",context_window: 1000000, 적절한 reasoning 수준을 포함한 모델 항목을 추가한 후~/.codex/config.toml을 설정하여 ModelStudio 제공자를 사용합니다. - Qoder CLI:
curl -fsSL https://qoder.com/install | bash로 설치하고qoder를 실행합니다. - Qwen Code:
npm install -g @qwen-code/qwen-code@latest로 설치하고qwen를 실행합니다. - OpenClaw: 설치 스크립트를 따르고,
DASHSCOPE_API_KEY를 설정하며,~/.openclaw/openclaw.json을 설정하여 QwenCloud 엔드포인트를 가리키도록 합니다.
결론
Qwen3.8‑Max는 massive scale(2.4 T 파라미터)과 오픈 가중치 가용성, 강력한 자기 진화 코딩 능력, 광범위한 실제 업무 역량, 하드웨어 설계 및 비즈니스 시뮬레이션에서의 장시간 최적화, 멀티모달 시각 피드백 루프를 결합하여 자율 AI 시스템의 경계를 확장합니다. 곧 출시될 가중치와 함께 더 작은 Qwen3.8‑27B 변형도 제공되어, 코딩, 전문 워크플로우, 연구, 창작 작업에서 최소한의 인간 감독으로 작동할 수 있는 에이전트를 구축하기 위한 강력한 기반을 커뮤니티에 제공합니다。
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch