Qwen3.8-Max 출시: 오픈 웨이트와 자율 코딩 성장을 가진 2.4T 파라미터 모델
개요
Qwen3.8-Max는 현재까지 Qwen 가족 중 가장 성능이 뛰어난 모델로, 2.4조 파라미터에 달하며 활성 파라미터는 950억 개이며, 오픈 소스화될 첫 번째 Qwen‑Max‑클래스 모델의 가중치를 제공합니다(다음 주에 출시 예정). 이 모델은 코딩, 실제 업무, 연구, 장시간 작업 전반에 걸쳐 종합적인 향상을 제공하여 최소한의 인간 개입으로 복잡한 목표를 끝까지 수행할 수 있게 합니다.
코딩 능력
Qwen3.8-Max는 인간 개입 없이 처음부터 끝까지 다일 소프트웨어 프로젝트를 자율적으로 이끌 수 있습니다. 10일 이상 실행 시 oh-my-cli 자가 진화형 하arnes을 구축하여 2026년 7월 30일까지 265개의 커밋, 127개의 풀 리퀘스트, 151개의 이슈를 축적했습니다. 이 하arnes은 이슈 상태 머신, 디스패처, 모니터, 워치독을 결합하며, 각 업데이트 후 Build, 단위 테스트, E2E 및 데스크톱 라이프사이클 검증을 트리거하고 비정상 상태를 관련 이슈/PR로 라우팅하여 수정합니다. 또한 커뮤니티 피드백과 자체 테스트 결과를 실행 가능한 작업으로 변환하여 /goal, /resume, 동적 워크플로우, 세션 재생, 데스크톱과 같은 기능을 지속적으로 개선합니다.
별도의 실험에서 Qwen3.8-Max는 논문 "Unified Data Selection for LLM Reasoning" 을 처음부터 재현한 후 이를 개선했습니다. 약 5일 동안 약 7,600줄의 코드를 작성하고 33번의 GPU 학습 라운드를 실행하여 논문의 여섯 가지 주요 결과를 재현했으며, 무작위 데이터 선택보다 AIME24에서 +7.7 % 향상을 달성했습니다. 자체 진화 연구 루프를 통해 네 라운드에 걸쳐 18개의 아이디어를 테스트한 결과, 어려운 의사 결정점("nhighgate"이라고 함)을 세는 방법을 발명하여 논문의 접근 방식보다 AIME24에서 +2.7점의 향상을 달성했습니다.
Qwen3.8-Max는 알리바바 클라우드의 Tianchi 플랫폼에서 열린 WWW2025 멀티모달 대화 의도 인식 챌린지에 참가했으며, 여기서 526개의 인간 팀이 경쟁했습니다. 24시간 제한 내에서 자율적으로 작업하여 BERT, MacBERT, RoBERTa를 미세 조정하고 앙상블한 텍스트 솔루션, 중국‑CLIP을 기반으로 한 Qwen2.5‑VL‑7B를 미세 조정하여 스크린샷을 처리하고, 교차 검증으로 보정된 가중 투표 시스템으로 융합했습니다. 정확도는 45번의 제출 과정에서 0.60에서 0.853으로 상승하여 526팀 중 458팀(전체의 87 %)을 앞섰습니다.
이 세 가지 사례는 Qwen3.8-Max가 며칠 동안 개방형 목표에 집중하고, 자체 가설을 생성하며, 인간 개입 없이 이를 작동 가능한 결과로 전환할 수 있음을 보여줍니다.
업무 능력
코딩 외에도 Qwen3.8-Max는 실제 업무에서 나타나는 도구 intensive 워크플로를 처리하도록 훈련되었습니다. 실제 강화 학습(RL) 시스템을 확장하는 데는 세 가지 coupled 과제가 포함되었습니다: (1) 작업, 워크스페이스, 하arnes 축을 따라 분리된 실제 환경을 지속적으로 확장하여 성장이 조합적으로 증가하도록 함; (2) 실행 기반 검사, 텍스트 및 시각 출력에 대한 루브릭 조건 adjudication, 자동으로 확장 가능한 루브릭 하에 에이전트 검사를 통합하는 보편적 보상 시스템 구축; (3) 작업, 난이도, 워크스페이스 및 하arnes에 대해 각 배치가 높은 균형을 유지하도록 온라인 데이터 밸런서를 고용하여 배치 간 그래디언트 분산을 억제하고 안정적인 RL 확장을 가능하게 함.
결과적으로 Qwen3.8-Max는 RL 학습이 확장됨에 따라 사내 및 공개 작업 벤치마크 수십 개에서 안정적이고 일관된 향상을 보이며, QwenWork, Claude Code, Codex, OpenClaw, Hermes와 같은 하arnes 사이에서 유사한 성능을 달성합니다.
수백 개의 고가치 직업에 대한 폭넓은 테스트에서 대표적인 결과가 나왔습니다:
- 기업 컴플라이언스 변호사: 수백 개의 문서에서 1,284개의 관련 조항을 한 시간 이내에 발굴했으며, 이는 패럴리걸 팀이 일주일 걸리는 것과 비교됩니다.
- UI/UX 디자이너: NOVA 뱅킹 앱용 8화면 고충실도 인터랙티브 프로토타입을 한 번에 zero 수정 라운드로 제작했으며, 이는 기존의 3–5 라운드와 비교됩니다.
- 레스토랑 브랜드 창시자: 칼로리 값과 원산지 정보를 포함한 26가지 요리 메뉴를 생성하여 식품 비용 비율을 33.8 %로 유지한 한 번의 패스로 제공했으며, 이는 수주에 걸친 반복 테스트와 비교됩니다.
- 구조 엔지니어: 브라우저에서 30층 사무실 타워의 지진 모델을 재구성하여 자연 주기, 기초 전단력 및 층간 변형 비율을 호버 시 확인할 수 있도록 했으며, 이는 전문 소프트웨어에서 일주일 이상 걸리는 것과 비교됩니다.
- 재활 치료사: 2D 종이 평가를 회전 가능한 view와 해부학적 오버레이가 있는 3D 인터랙티브 데모로 변환하여 의료 애니메이션 스튜디오의 2–4주, 천 달러 워크플로를 대체했습니다.
- 스포츠 데이터 분석가: 약 8,400개의 공격/수비 소유를 선수당 전술 프로필과 코칭 보고서로 파싱하여 몇 분 안에 처리했으며, 이는 기존 팀이 며칠 걸리는 것과 비교됩니다.
Qwen3.8-Max는 양적 연구에서도 깊이를 보여주었습니다: 여섯 개의 짧은 팩터 가족 설명으로부터 약 330개의 하위 에이전트를 생성하고 약 6,000번의 백테스트를 실행하며 워크플로를 지속적으로 적응시켰습니다. 선정된 팩터는 초과 샤프 비율이 0.641.48이며, 정보 계수는 0.0100.014 사이에서 일관되게 양수였습니다. 모델은 과적합된 팩터를 동적으로 가지치기하고, 다중 시드 연합 검증을 추가하여 경로 의존성을 제거했으며, 앙상블이 효과적이지 않을 때는 보다 떨어질 때는 보다 강력한 합성 전략으로 전환했습니다.
これらの例は、Qwen3.8‑Maxが多様なプロフェッショナルワークフローで本番品質の結果を提供できることを示しており、しばしば人間の労力を何週間もかける作業を単一の自律セッションに圧縮します。
장시간 작업 성능
Qwen3.8‑Max는 수천 번의 상호작용 턴이 필요한 작업에 대해 시스템 수준의 자율 계획 및 폐쇄 루프 적응 학습을 강력히 보여줍니다.
자율 칩 설계에서 모델은 GCD/RSA 암호화 하드웨어 가속기의 전체 실리콘 흐름을 독립적으로 실행했습니다. stub RTL 워크스페이스에서 시작하여 13개의 마일스톤에 걸쳐 500턴과 71번의 평가를 수행하여 게이트 수를 8,298에서 678로 줄였습니다(다이 면적 81 % 감소) 및 500 MHz에서 타이밍 클로저를 달성하고 +0.66 ns의 슬랙을 얻었습니다. 주요 마일스톤에는 16비트 하드웨어 모듈러 divider를 반복적인 shift‑subtract 아키텍처로 교체(6,288게이트 절약), 중복 제거, 비트폭 트리밍, 제어 FSM 가지치기, 모듈 융합, 공유 NOR‑gate 트리와 절대‑차이 뺄셈 분할과 같은 게이트‑레벨 개선 적용이 포함되었습니다. OpenROAD를 통한 물리적 구현은 프론트엔드 최적화가 직접 컴팩트하고 라우팅 가능한 실리콘으로 변환됨을 확인했습니다.
365일 전자상거래 벤치 시뮬레이션에서 Qwen3.8‑Max는 ¥100,000 자본으로 시작하여 152개의 사기 상인이 포함된 공급업체 매트릭스와 협상하고, 현실적인 계절적 충격 하에서 재고, 가격, 반품 및 현금 흐름을 관리했습니다. 가격 협상에서 지속적인 학습을 달성하여 시간이 지남에 따라 협상 효율성을 확장하고 유사한 제품에 대한 이득을 일반화했습니다. 모델은 초기에 시장 지위를 확립하기 위해 대규모 투자를 진행하여 연말 프로모션 동안 순이익이 ¥100,000를 초과하도록 했으며—이는 2위인 GLM 5.2의 거의 2.4배에 해당합니다. 최종 총 잔액은 ¥416,252에 도달했습니다(4.16 × 수익), 이는 GLM 5.2를 38 % 앞선 것이며, 전신 Qwen3.7‑Max보다 152 % 개선된 수치입니다. 이러한 결과는 Qwen3.8‑Max가 2,000번 이상의 상호작용 라운드에 걸친 거래 피드백으로부터 장기적인 일관된 의사 결정 및 적응 학습 능력을 보여줍니다.
멀티모달 에이전트 능력
Qwen3.8‑Max는 시각을 계획, 실행, 검증 및 반복을 아우르는 네이티브 피드백 루프로 취급합니다. 이미지, 문서 및 100시간보다 긴 비디오 전반에 걸쳐 콘텐츠를 이해하고 생성할 수 있으며, 사람, 이벤트, 타임스탬프 및 장면을 연결하는 비디오 메모리 그래프를 구축합니다. 실행 중에 페이지 레이아웃, 객체 방향, 공간 관계, 애니메이션 품질 및 상호작용 결과와 같은 중간 결과를 지속적으로 검사하고 불일치가 감지될 때 계획을 자율적으로 수정합니다.
또한 코드 생성과 GUI 작업을 결합한 하이브리드 에이전트 워크플로를 지원합니다. RecreationBench 벤치마크(Ubuntu, macOS, Windows, Android 및 웹 포함)에서 Qwen3.8‑Max는 블랙박스 바이너리와 상호작용하여 코딩 및 GUI 피드백 사이클을 반복하면서 처음부터 애플리케이션을 재구축했습니다. 통합을 용이하게 하기 위해 연구소는 이미지/비디오 처리, 멀티모달 메모리, 동적 해상도 지원, 시각적 도구 사용, 비디오 편집, Blender 및 CAD를 위한 특수 기능을 제공하는 Qwen‑MM‑Plugins이라는 하arnes 확장을 출시했습니다.
배포 및 접근
Qwen3.8-Max는 QwenCloud를 통해 이용 가능합니다. API 사용에는 세 가지 수준의 reasoning_effort 매개변수가 포함됩니다:
xhigh(기본값): 철저한 분석이 필요한 복잡한 작업용medium: 정확도와 속도의 균형low: 속도와 비용 최적화preserve_thinking은 최상의 out‑of‑the‑box 경험을 위해 기본적으로 활성화됩니다.
OpenAI‑호환 엔드포인트를 통해 모델을 호출하는 예시 코드가 소스에 제공되어 있으며, 여기서 model="qwen3.8-max" 설정, 사고 활성화 및 응답 스트리밍 방법을 보여줍니다.
모델은 인기 있는 에이전트 프레임워크 및 코딩 어시스턴트와 통합됩니다:
- Claude Code:
ANTHROPIC_MODEL="qwen3.8-max"설정 및 QwenCloud 기본 URL 지정. - Codex:
~/.codex/model-catalog.local.json에context_window1,000,000 및 지원되는 reasoning 수준 low/medium/xhigh를 가진 모델 항목 추가. - Qoder CLI: 제공된 스크립트로 설치하고
qoder실행. - Qwen Code:
@qwen-code/qwen-code@latest설치 및qwen실행. - OpenClaw:
~/.openclaw/openclaw.json을 구성하여 QwenCloud 호환 모드 엔드포인트 사용.
모델 가중치는 발표 다음 주에 Hugging Face와 ModelScope에서 오픈 소스로 공개될 예정입니다.
커뮤니티 반응 (Hacker News 댓글에서)
댓글 작성자들은 여러 주목할 만한 점을 강조했습니다:
- 곧 출시될 Qwen3.8‑27B 밀집 모델이 로컬 추론에 잠재적으로 значи할 수 있다는 점이 언급되었으며, 한 사용자는 "Qwen3.8‑27B는 여기서 진짜 뉴스입니다."라고 말했습니다. ([@boredatoms])
- 한 사용자는 미리보기 버전(Qwen3.8‑Max‑Preview)이 이미 7월 19일부터 알리바바의 Token Plan, Qoder 및 QoderWork에서 제공되었다고 지적하며, 8월 3일 발표가 무엇을 추가하는지 의문을 제기했습니다. ([@simonw])
- 비용에 대한 논의:
reasoning_effort옵션이 비용을 통제하는 방법으로 언급되었으며, 한 댓글 작성자는これが「代替案よりも「大幅に安価」になることを望んでいると述べました。 ([@ddxv]) - 모델의 자체 진화 행동이 다른 모델로부터의 증류를 포함하는지에 대한 추측, 예를 들어 "これはClaudeを蒸留したということですか?" ([@choppaface])
- 첫 번째 오픈‑웨이트 Qwen‑Max‑클래스 모델 출시에 대한 열정, "Nice!"라고 묘사됨 ([@wxw]) 및 "오픈소스 커뮤니티는 이 괴물을 호스팅하기에 충분한 VRAM을 사기 위해 집단적인 GoFundMe가 필요할 것 같습니다." ([@khanhnguyen8386])
- 로컬에서 모델을 실행하는 데 대한 실제 우려 사항, 하드웨어 요구 사항(한 사용자는 2080 Ti가 27B 밀집 모델로 어려움을 겪는다고 언급) 및 2.4T‑파라미터 버전을 호스팅하기 위한 상당한 VRAM 필요성. ([@aliljet], [@khanhnguyen8386])
- 비디오/이미지 생성으로 모델 확장에 대한 관심, 어떤 비디오 또는 이미지 생성 기능이 출시될 것인지에 대한 질문. ([@SXX])
- 일부 사용자는 новиз나에 대한 회의론을 표현했으며, 벤치마크 향상이 이전 모델에 비해 점진적이라고 지적했습니다. ([@HarHarVeryFunny])
- 몇 명의 댓글 작성자는 데이터 보존 정책에 대한 우려를 제기했으며, QwenCloud가 API 입력을 학습에 사용하는지 명확히 해줄 것을 요청했습니다. ([@Aldipower])
이러한 커뮤니티 통찰은 오픈‑웨이트 출시への興奮、コストとアクセシビリティへの好奇心、およびモデルの実用性と制限に関する継続的な議論を反映しています。
벤치마크 하이라이트
게시물에는 Opus4.8, Fable5, GPT5.6 Sol (max) 및 Qwen3.7‑Max와 비교한 Qwen3.8‑Max의 상세 벤치마크 표가 포함되어 있습니다. 선택된 결과:
- 코딩 에이전트: Terminal Bench 2.1 86.6 % (Qwen3.7‑Max 대비 74.5 %), SWE‑bench Pro 67.7 % (대비 60.6 %), DeepSWE 1.1 56.6 % (대비 21.6 %), PaperBench 93.0 % (대비 64.8 %), QwenSWEBench 80.7 % (대비 63.4 %).
- 일반 에이전트: CoWorkBench 74.8 % (대비 64.6 %), WorkSpaceBench 67.7 % (대비 61.4 %), JobBench 53.4 % (대비 31.3 %), SkillsBench 70.2 % (대비 61.2 %).
- 일반 능력: GPQA Diamond 92.6 % (대비 92.4 %), IFBench 82.8 % (대비 79.1 %), HealthBench 60.2 % (대비 54.5 %), PLawBench 73.2 % (대비 58.9 %).
- 장시간 컨텍스트: MRCR v2 256K 92.9 % (대비 86.7 %), LongBench v2 66.3 % (대비 65.3 %).
- 멀티모달 추론: MMMU‑Pro 82.3 % (대비 79.0 %), MathVision 95.2 / 97.7 (대비 90.3 / --), BabyVision 82.0 / 91.3 (대비 64.7 / 70.4), HiPhO 90.0 % (대비 84.1 %).
- 시각 에이전트 및 코딩: OSWorld‑Verified 86.1 % (대비 73.3 %), AndroidWorld 85.3 % (대비 81.0 %), Parametric CAD Bench 91.5 % (대비 73.8 %).
- 문서 및 사무실 인텔리전스: CharXiv (RQ) 88.4 / 93.5 (대비 85.8 / 85.9), OmniDocBench 1.5 92.1 % (대비 91.4 %).
- 실제 세계 및 공간 이해: RealWorldQA 88.0 % (대비 86.9 %), ERQA 77.8 % (대비 69.8 %).
- 비디오 지능 및 에이전트: VideoMME (w/ Sub.) 90.4 % (대비 88.0 %), VideoMMMU 88.7 % (대비 85.4 %).
これらの数値は、Qwen3.8‑Maxが前モデルおよび競合モデルと比較して、コーディング、一般的なエージェンシー、マルチモーダル推論、および長コンテキストタスクにおいてどのように進歩しているかを示しています。
전망
Qwen3.8‑Max는 massive 규모와 오픈 웨이트, 코딩 및 연구에서의 강력한 자체 진화 루프, 다양한 전문 워크플로에서의 입증된 숙련도를 결합하여 자율적, 장시간 AI 에이전트에 대한 새로운 기준을 확립합니다. upcoming 2.4T‑파라미터 가중치 출시 및 더 작은 27B 밀집 변형은 보다 넓은 실험을 가능하게 할 것이며, 제공된 API 및 프레임워크 통합은 에이전트 시스템 구축의 장벽을 낮추는 것을 목표로 합니다. 지속적인 커뮤니티 피드백은 실제 세계에서의 사용성, 비용 효율성 및 비디오 또는 이미지 생성 기능과 같은 잠재적 확장을 평가하는 데 필수적입니다.