Qwen3.8-Max 릴리스 노트 / 새로운 기능

Qwen은 현재까지 Qwen 제품군에서 가장 성능이 뛰어난 모델인 Qwen3.8-Max의 출시를 발표했습니다. 2.4조 개의 파라미터(활성 95B)로 확장된 이 모델은 복잡하고 개방된 목표를 엔드 투 엔드로 처리하도록 설계되었으며, 자율 코딩, 전문 연구, 장기 작업 실행 분야의 개선을 구체적으로 목표로 합니다.

자율 코딩 및 자기 진화

Qwen3.8-Max는 단순한 함수 생성에서 자율 프로젝트 관리로 전환됩니다. 이 모델은 피드백 루프를 통한 자기 진화 능력을 보여주며, 이는 세 가지 주요 테스트 케이스로 입증됩니다:

  • Self-Evolving Harness: 10+일 자율 실행 중에 모델은 oh-my-cli 프로젝트를 처음부터 구축했습니다. 이슈 상태 머신, 디스패처, 워치독을 포함하는 루프를 구현하여 커뮤니티 피드백을 실행 가능한 작업으로 변환했습니다. 16일 후, 저장소는 265개의 커밋, 127개의 PR, 151개의 이슈를 축적했습니다.
  • Research Reproduction and Improvement: 모델은 125시간 동안 7,600줄의 코드를 작성하여 'Unified Data Selection for LLM Reasoning' 논문을 처음부터 재현했으며, 이후 원래 논문의 접근 방식을 능가하는 새로운 방법을 발전시켜 AIME24 벤치마크에서 +2.7점의 향상을 달성했습니다.
  • 경쟁 프로그래밍: WWW2025 멀티모달 대화 의도 인식 챌린지에서 Qwen3.8-Max는 526명의 인간 팀과 경쟁했습니다. 24시간 제한 내에서 자율적으로 작업하여 정확도 0.853을 달성했으며, 이는 인간 참가자의 87%를 앞서는 성적입니다.

전문 워크플로 통합

일반적인 작업 역량을 향상시키기 위해 Qwen은 QwenWork, Claude Code, Codex와 같은 여러 하네스에서 RL 환경과 컴퓨팅을 확장했습니다. 이는 실행 기반 검사와 에이전트 기반 검사를 통합하는 보편적 보상 시스템을 통해 달성되었습니다.

고가치 직업 성능

Qwen3.8-Max는 생산 품질의 결과를 제공하기 위해 수백 가지 직업에 걸쳐 스트레스 테스트를 받았습니다:

  • 법률: 한 시간 이내에 수백 개의 문서에 대한 기업 준수 검토를 완료했으며, 이는 일반적으로 패럴걸 팀이 일주일 동안 수행해야 하는 작업입니다.
  • UI/UX 디자인: 인간 수정 없이 한 번에 은행 앱용 고충실도 8화면 인터랙티브 프로토타입를 제작했습니다.
  • 엔지니어링: 도면에서 30층 사무실 타워의 지진 구조 모델을 재구성하여 기초 전단 및 층간 변위의 실시간 검사를 제공했습니다.
  • 의료: 2D 종이 평가를 3D 인터랙티브 해부학 데모로 변환하여 리드 타임을 주에서 분으로 단축했습니다.
  • 금융: end-to-end ETF 로테이션 전략을 개발하여 과적합을 피하기 위해 중복 요인을 자율적으로 제거하고 330개의 서브 에이전트를 통해 대규모 병렬 요인 채굴을 실행했습니다.

장기 작업 실행

Qwen3.8-Max는 수천 라운드의 상호작용이 필요한 작업을 처리하기 위해 액션-피드백-반복 루프를 활용합니다.

자율 칩 설계

이 모델은 GCD/RSA 암호화 하드웨어 가속기를 위한 전체 실리콘 설계 흐름을 실행했습니다. 참조 설계 없이, 'edit-simulate-synthesize-layout' 루프를 사용하여 설계를 8,298개 게이트에서 678개 게이트로 줄였습니다. 최종 물리 레이아웃은 다이 면적을 81% 감소시켰으며, 500 MHz에서 타이밍 클로저를 성공적으로 달성했습니다.

전자상거래 시뮬레이션

E-Commerce 벤치마크(365일 시뮬레이션)에서 Qwen3.8-Max는 여러 매장을 관리하고, 공급망 위기를 처리하며, 게임 이론 원칙을 바탕으로 공급업체와 협상했습니다. 총 잔액 ¥416,252(4.16배 수익)를 달성하여 2위 모델(GLM 5.2)를 38% 앞섰습니다.

멀티모달 지능 및 하이브리드 에이전트

Qwen3.8-Max는 시각적 지식을 작업 수명 주기의 전체에 통합하여 단순한 이미지 이해를 넘어 능동적인 시각적 피드백으로 나아갑니다.

  • 시각적 피드백 루프: 모델은 자체 중간 결과(예: 페이지 레이아웃 또는 애니메이션 품질)를 관찰하고 편차를 수정하기 위해 계획을 자율적으로 수정할 수 있습니다.
  • 하이브리드 에이전트 기능: 코딩과 GUI 작업을 결합하여 모델은 코드를 통해 로직을 구현하면서 라이브 시스템과의 결과를 검증할 수 있습니다. 이는 RecreationBench에서 테스트되었으며, 여기서 모델은 블랙박스 관찰로부터 애플리케이션을 재구성했습니다.
  • 비디오 메모리: 100시간을 초과하는 비디오에 대해, 모델은 캐릭터, 이벤트, 관계를 장기간에 걸쳐 추적하기 위한 비디오 메모리 그래프를 구성합니다.

기술 사양 및 가용성

  • 파라미터: 2.4조 (활성 95B).
  • 가용성: 현재 QwenCloud를 통해 이용 가능합니다.
  • 오픈 가중치: 다음 주에 Hugging Face와 ModelScope에서 출시될 예정입니다.
  • API 기능: reasoning_effort (xhigh, medium, low)를 지원하여 깊이와 비용의 균형을 맞추고, preserve_thinking을 통해 reasoning 과정의 투명성을 제공합니다.

Sources