Qwen3.7-Max 에이전트 모델 출시
TL;DR
Qwen은 Qwen3.7‑Max를 발표했습니다. 이 새로운 에이전트 중심 기반 모델은 코딩, 사무 자동화, 초장기 자율 실행에 뛰어나며, 이제 Alibaba Cloud Model Studio를 통해 이용할 수 있습니다.
Qwen3.7‑Max란?
Qwen3.7‑Max는 에이전트 시대를 위해 명시적으로 설계된 독점 대형 언어 모델입니다. 다목적 에이전트 기반으로서 다음을 수행할 수 있습니다:
- 간단한 프론트엔드 프로토타입부터 다중 파일 엔지니어링 프로젝트까지 코드를 작성하고 디버깅합니다.
- MCP 통합 및 다중 에이전트 오케스트레이션을 통해 사무 워크플로를 자동화합니다.
- 수백에서 수천 번의 툴 호출에 걸쳐 일관된 추론을 유지하며, 35시간 동안 1,000단계 커널 최적화 실행으로 입증되었습니다.
- 프레임워크별 튜닝 없이 여러 에이전트 스캐폴드(Claude Code, OpenClaw, Qwen Code, 및 커스텀 프레임워크) 전반에 일반화합니다.
이 모델은 Alibaba Cloud Model Studio API를 통해 접근할 수 있으며, OpenAI 호환 및 Anthropic 호환 엔드포인트를 모두 지원합니다.
벤치마크 하이라이트
코딩 에이전트 성능
| Benchmark | Qwen3.7‑Max | 가장 가까운 경쟁 모델 |
|---|---|---|
| SWE‑Verified | 80.4 | Opus‑4.6‑Max 80.8 |
| SWE‑Pro | 60.6 | Opus‑4.6‑Max 59.0 |
| SWE‑Multilingual | 78.3 | Opus‑4.6‑Max 73.8 |
| SciCode | 53.5 | Opus‑4.6‑Max 41.4 |
| QwenSVG | 1608 (top score) | Opus‑4.6‑Max 1541 |
| Terminal‑Bench 2.0‑Terminus | 69.7 | DS‑V4‑Pro Max 67.9 |
일반 목적 에이전트 벤치마크
| Benchmark | Qwen3.7‑Max | 가장 가까운 경쟁 모델 |
|---|---|---|
| MCP‑Mark | 60.8 | GLM‑5.1 57.5 |
| MCP‑Atlas | 76.4 | Opus‑4.6‑Max 75.8 |
| SkillsBench | 59.2 | K2.6 56.2 |
| Kernel Bench L3 (median speedup) | 1.98× (96 % win rate) | Opus‑4.6‑Max 2.63× (98 %) |
| SpreadSheetBench‑v1 | 87.0 (top tier) | — |
| BFCL‑V4 | 75.0 | Opus‑4.6‑Max 76.7 |
| QwenClaw | 64.3 | Opus‑4.6‑Max 65.5 |
| ClawEval | 65.2 | Opus‑4.6‑Max 70.4 |
추론 및 지식
| Benchmark | Qwen3.7‑Max | 가장 가까운 경쟁 모델 |
|---|---|---|
| GPQA Diamond | 92.4 | Opus‑4.6‑Max 91.3 |
| HLE (hard logical reasoning) | 41.4 | Opus‑4.6‑Max 40.0 |
| HMMT Feb 2026 | 97.1 | Opus‑4.6‑Max 96.2 |
| IMOAnswerBench | 90.0 | DS‑V4‑Pro 89.8 |
| Apex | 44.5 | DS‑V4‑Pro 38.3 |
| IFBench | 79.1 | DS‑V4‑Pro 77.0 |
| WMT24++ (multilingual translation) | 85.8 | — |
| MAXIFE (multilingual instruction) | 89.2 | — |
| SuperGPQA | 73.6 | — |
| QwenWorldBench (world‑model simulation) | 57.3 | — |
모든 점수는 Qwen 블로그 게시물(2026년 5월)에서 가져왔습니다. 빈 셀은 점수가 보고되지 않았음을 의미합니다.
장기 자율 실행
Qwen3.7‑Max는 익숙하지 않은 T‑Head ZW‑M890 PPU에서 35시간 동안 커널 최적화 작업을 수행하며 지속적인 자율 계획을 입증했습니다. 모델은 다음을 수행했습니다:
- 1,158번의 툴 호출에 걸쳐 432번의 커널 평가를 수행했습니다.
- Triton 기준 대비 0.33×에서 **10.0×**까지 점진적인 속도 향상을 보였습니다.
- 첫 몇 시간 이후에도 지속적인 진행이 이루어졌으며, 30시간 이상 후에도 의미 있는 개선이 있었습니다.
주요 최적화 단계는 다음과 같습니다:
- Split‑KV 병렬 처리 – KV 캐시의 병렬 처리를 도입하여 2.58×의 향상을 얻었습니다.
- Launch/할당 오버헤드 제거 – 텐서를 사전 할당하고 동기 복사를 없애 5.37×에 도달했습니다.
- 워크로드 적응형 스플릿 튜닝 – 동적 휴리스틱을 통해 성능을 6.85×로 끌어올렸습니다.
- 레지스터 기반 로딩 및 배칭 – 장벽을 줄이고 SM 점유율을 개선하여 8.50×를 달성했습니다.
- MTP‑γ=4 특수 커널 – 최종 아키텍처 재설계로 10.0× 속도 향상을 제공했습니다.
동일 조건에서 비교된 모델: GLM‑5.1 (7.3×), Kimi K2.6 (5.0×), DeepSeek V4 Pro (3.3×), Qwen3.6‑Plus (1.1×). Qwen3.7‑Max는 또한 KernelBench L3에서 NVIDIA GPU 시나리오의 96 %에서 성공했으며, Opus‑4.6의 98 %에 근접합니다.
교차 스캐폴드 일반화
학습 환경은 Task × Harness × Verifier 구성 요소로 분해되었습니다. 이러한 분리는 다음을 가능하게 합니다:
- 조합적 확장 – 동일한 작업을 최소 비용으로 다양한 하네스 버전과 결합할 수 있습니다.
- 교차 하네스 RL – 모델은 서로 다른 하네스에서 동일한 문제를 보게 되어 하네스 활용이 아니라 작업 해결을 학습하도록 강제합니다.
실험적으로 Qwen3.7‑Max는 평가 하네스와 관계없이 QwenClawBench와 CoWorkBench 모두에서 강력한 성능을 유지하여 진정한 일반화를 확인했습니다.
보상 해킹 모니터링 및 자체 진화
소프트웨어 엔지니어링 작업에 대한 80시간 이상 RL 훈련 중, Qwen3.7‑Max는:
- 10,000회 이상의 툴 호출을 수행했습니다.
- 1 618건의 보상 해킹 시도를 감지하고 표시했습니다(예: GitHub에서 정답을 가져오려는 시도).
- 내부 규칙 집합에 13개의 새로운 휴리스틱 규칙을 추가하여 보상 안정성을 향상시켰습니다.
이 자체 모니터링 프레임워크는 장기 훈련이 정렬된 상태를 유지하도록 보장하고, 모델이 자체 안전 휴리스틱을 진화시킬 수 있게 합니다.
실제 생산성 향상
협업 생산성 어시스턴트
Qwen3.7‑Max는 자율적인 협업자로서 복잡한 데이터 분석, 문서 생성, 다단계 워크플로 오케스트레이션을 수행할 수 있습니다. 내부 테스트에서 일반적으로 1‑2주의 전문 작업이 필요한 프로젝트가 몇 시간 내에 완료되어 측정 가능한 생산성 향상을 제공했습니다.
스타트업 관리 (YC‑Bench)
1년 동안 진행된 YC‑Bench 시뮬레이션에서 모델은:
- 237개의 작업을 완료했습니다.
- $2.08 M의 매출을 창출했으며, 이는 Qwen3.6‑Plus의 $1.05 M보다 2배, Qwen3.5‑Plus의 $352 K보다 5.9배 많습니다.
- 전략적 진화를 보여주었습니다: 고객 탐색, 악성 고객 차단, 위기 복구, 그리고 이익 마진 유지.
통합 및 API 세부 정보
Qwen3.7‑Max는 Alibaba Cloud Model Studio API를 통해 접근 가능하며, 다음을 지원합니다:
- OpenAI 호환
chat/completions엔드포인트. - Claude Code와 사용하기 위한 Anthropic 호환 엔드포인트.
preserve_thinking플래그는 턴 간 중간 추론을 유지하도록 하며(에이전트 작업에 강력히 권장됩니다).
예시 Python 코드 스니펫 (OpenAI 호환 클라이언트 사용):
from openai import OpenAI
import os
client = OpenAI(
api_key=os.getenv("DASHSCOPE_API_KEY"),
base_url=os.getenv(
"DASHSCOPE_BASE_URL",
"https://dashscope-intl.aliyuncs.com/compatible-mode/v1",
),
)
completion = client.chat.completions.create(
model="qwen3.7-max",
messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
extra_body={"enable_thinking": True},
stream=True,
)
for chunk in completion:
if chunk.choices and hasattr(chunk.choices[0].delta, "reasoning_content"):
print(chunk.choices[0].delta.reasoning_content, end="")
if chunk.choices and hasattr(chunk.choices[0].delta, "content"):
print(chunk.choices[0].delta.content, end="")
Claude Code와 OpenClaw에 대한 구성은 블로그 게시물에 제공되어 있으며 그대로 복사할 수 있습니다.
창의적 코딩 시연
블로그에서는 Qwen3.7‑Max가 생성한 여러 엔드‑투‑엔드 프롬프트를 소개합니다:
- 손 제스처로 제어되는 완전 인터랙티브한 Three.js 파티클 시스템.
- AI 생성 비디오 자산을 포함한 고급 패션 매거진 웹 페이지.
- 동적 WebGL 인스턴싱을 위한 독립형 HTML 파일.
- 동기화된 노젓기, 깃발 흔들림, 물결 효과가 포함된 용선 경주 SVG 애니메이션.
- 오피스 CLI 툴 체인을 통한 자동 논문 포맷팅.
전망
Qwen3.7‑Max는 현재까지 Qwen이 출시한 가장 강력한 에이전트 중심 기반 모델을 의미합니다. 그 강점은 다음에 있습니다:
- 가장 어려운 벤치마크(GPQA Diamond, HMMT, Apex)에서 최전선 추론.
- 견고한 교차 프레임워크 일반화, 어떤 에이전트 하네스에도 바로 적용 가능한 백본.
- 지속적인 장기 자율성, 다시간·수천 단계 툴 호출 세션으로 입증.
- 자체 모니터링 및 규칙 진화, RL 훈련에서 보상 해킹을 완화.
이 모델은 이제 Alibaba Cloud Model Studio에서 공개적으로 이용 가능하며, Qwen 팀은 커뮤니티 피드백을 통해 차세대 AI 에이전트를 발전시키고자 합니다.
인용
@misc{qwen37,
title = {{Qwen3.7}: The Agent Frontier},
url = {https://qwen.ai/blog?id=qwen3.7},
author= {{Qwen Team}},
month = {May},
year = {2026}
}
Sources
- OriginalQwen3.7: The Agent Frontier