Qwen3.7-Max: 장기적 자율 에이전트의 경계를 넓히다
대규모 언어 모델(LLM)의 지형은 단순한 채팅 인터페이스에서 복잡하고 다단계 워크플로우를 실행할 수 있는 자율 에이전트로 변화하고 있습니다. Alibaba의 최신 출시작인 Qwen3.7-Max는 단기적 추론과 장기적 실행 사이의 간극을 메우기 위해 설계된 "에이전트 기반(agent foundation)"으로 자리매김하고 있습니다.
이전 버전들과 달리, Qwen3.7-Max는 수백 또는 수천 단계에 걸쳐 일관된 추론을 유지하는 능력에 집중하며, 이를 통해 소프트웨어 엔지니어링, 사무 생산성, 심지어 물리적 세계의 로보틱스 분야에서도 실행 가능한 백본(backbone) 역할을 할 수 있게 합니다. 이러한 "에이전트적(agentic)" 능력으로의 전환은 단순히 코드를 제안하는 모델에서 35시간 동안 커널을 자율적으로 최적화할 수 있는 모델로의 전환을 의미합니다.
에이전트 성능을 위한 새로운 벤치마크
Qwen3.7-Max는 여러 전문화된 에이전트 벤치마크에서 상당한 발전을 보여줍니다. 특히 코딩 및 범용 에이전시 성능이 눈에 띕니다:
코딩 및 엔지니어링
Terminal Bench 2.0-Terminus에서 Qwen3.7-Max는 69.7점을 기록하여 DS-V4-Pro Max(67.9)를 능가했습니다. SWE-Verified에서는 최고 수준의 모델인 Opus-4.6 Max(80.4 vs 80.8)와 경쟁력을 유지하고 있습니다. 다중 파일 엔지니어링 및 프론트엔드 프로토타이핑을 처리하는 능력은 설계의 핵심 축이며, 이를 통해 복잡한 소프트웨어 엔지니어링 작업을 위한 즉각적인 대체재로 기능할 수 있게 합니다.
범용 에이전시 및 사무 자동화
이 모델은 도구 사용 및 오케스트레이션(orchestration) 능력에서 뚜렷한 향상을 보여줍니다. MCP-Mark(60.8)와 MCP-Atlas(76.4)에서 선두를 달리고 있으며, SpreadSheetBench-v1에서는 87점이라는 최고 수준의 점수를 달성했습니다. 이러한 결과는 Model Context Protocol (MCP) 및 멀티 에이전트 프레임워크와 통합되었을 때 높은 신뢰도를 가질 수 있음을 시사합니다.
고난도 추론
순수 추론 영역에서는 Qwen3.7-Max가 가장 도전적인 벤치마크인 GPQA Diamond(92.4)와 HMMT 2026 Feb(97.1)에서 선두를 달리는 결과를 달성하여, 두 카테고리 모두에서 Opus-4.6 Max를 능가했습니다.
지속적인 자율성: 35시간 커널 최적화
Qwen3.7-Max의 능력을 보여주는 가장 인상적인 시연은 실제 환경에서의 성능입니다. 연구팀은 모델에게 훈련 과정에서 한 번도 접해보지 못한 하드웨어 플랫폼인 T-Head ZW-M890 PPU에서 프로덕션급 어텐션 연산자(Extend Attention)를 최적화하는 과제를 부여했습니다.
단순히 작업 설명과 기존 Triton 구현체를만 가지고 시작하여, 모델은 약 35시간 동안 자율적으로 작동하며 1,158회의 도구 호출과 432회의 커널 평가를 수행했습니다. 최적화 과정은 단순한 운이 아니라, 다음과 같은 다섯 가지의 뚜렷렷한 구조적 전환을 포함하는 지속적인 노력이었습니다:
- Split-KV Parallelism: 커널을 재설계하여 KV-cache를 여러 스레드 블록으로 나누는 방식입니다.
- Overhead Removal: 동기식
cudaMalloc/cudaFree를 사전 할당된 텐서로 교체하는 방식입니다. - Adaptive Tuning: SM 점유율을 최대화하기 위해 작업 부하 크기에 따른 휴리스틱을 구현하는 방식입니다.
- Reduction Optimizations: 레지스터 기반 로딩과 배치 소프트맥스 업데이트로 전환하는 방식입니다.
- Specialized MTP Kernel: 네 개의 쿼리 토큰을 동시에 처리하기 위한 최종적인 아키텍처 재설계입니다.
그 결과, 참조 구현체 대비 10.0x 기하 평균 속도 향상을 달성했으며, 이는 GLM 5.1(7.3x) 및 DeepSeek V4 Pro(3.3x)와 같은 다른 최첨단 모델들의 결과를 훨씬 뛰어넘는 수치입니다.
아키텍처 혁신: 환경 스케일링 및 일반화
Qwen3.7-Max의 능력은 Environment Scaling 전략에 의해 구동됩니다. LLM이 다양한 { "type": "object", "properties": { "body": "# Qwen3.7-Max: 장기적 자율 에이전트의 경계를 넓히다\n\n대규모 언어 모델(LLM)의 지형은 단순한 채팅 인터페이스에서 복잡하고 다단계 워크플로우를를 실행할 수 있는 자율 에이전트로 변화하고 있습니다. Alibaba의 최신 출시작인 Qwen3.7-Max는 단기적 추론과 장기적 실행 사이의 간극을 메우기 위해 설계된 "에이전트 기반(agent foundation)"으로 자리매김하고 있습니다.\n\n이전 버전들과 달리, Qwen3.7-Max는 수백 또는 수천 단계에 걸쳐 일관된 추론을 유지하는 능력에 집중하며, 이를 통해 소프트웨어 엔지니어링, 사무 생산성, 및 심지어 물리적 세계의 로보틱스 분야에서도 실행 가능한 백본(backbone) 역할을 할 수 있게 합니다. 이러한 "에이전트적(agentic)" 능력으로의 전환은 단순히 코드를 제안하는 모델에서 35시간 동안 커널을 자율적으로 최적화할 수 있는 모델로의 전환을 의미합니다.\n\n## 에이전트 성능을 위한 새로운 벤치마크\n\nQwen3.7-Max는 여러 전문화된 에이전트 벤치마크에서 상당한 발전을 보여줍니다. 특히 코딩 및 범용 에이전시 성능이 눈에 띕니다:\n\n### 코딩 및 엔지니어링\nTerminal Bench 2.0-Terminus에서 Qwen3.7-Max는 69.7점을 기록하여 DS-V4-Pro Max(67.9)를 능가했습니다. SWE-Verified에서는 최고 수준의 모델인 Opus-4.6 Max(80.4 vs 80.8)와 경쟁력을 유지하고 있습니다. 다중 파일 엔지니어링 및 프론트엔드 프로토타이핑을을 처리하는 능력은 설계의 핵심 축이며, 이를 통해 복잡한 소프트웨어 엔지니어링 작업을 위한 즉각적인 대체재로 기능할 수 있게 합니다.\n\n### 범용 에이전시 및 사무 자동화\n이 모델은 도구 사용 및 오케스트레이션(orchestration) 능력에서 뚜렷한 향상을 보여줍니다. MCP-Mark(60.8)와 MCP-Atlas(76.4)에서 선두를 달리고 있으며, SpreadSheetBench-v1에서는 87점이라는 최고 수준의 점수를 달성했습니다. 이러한 결과는 Model Context Protocol (MCP) 및 멀티 에이전트 프레임워크와 통합되었을 때 높은 신뢰도를 가질 수 있음을 시사합니다.\n\n### 고난도 추론\n순수 추론 영역에서는 Qwen3.7-Max가 가장 도전적인 벤치마크인 GPQA Diamond(92.4)와 HMMT 2026 Feb(97.1)에서 선두를 달리는 결과를 달성하여, 두 카테고리 모두에서 Opus-4.6 Max를 능가했습니다.\n\n## 지속적인 자율성: 35시간 커널 최적화\n
Qwen3.7-Max의 능력을 보여주는 가장 인상적인 시연은 실제 환경에서의 성능입니다. 연구팀은 모델에게 훈련 과정에서 한 번도 접해보지 못한 하드웨어 플랫폼인 T-Head ZW-M890 PPU에서 프로덕션급 어텐션 연산자(Extend Attention)를 최적화하는 과제를 부여했습니다.\n\n단순히 작업 설명과 기존 Triton 구현체를만 가지고 시작하여, 모델은 약 35시간 동안 자율적으로 작동하며 1,158회의 도구 호출과 432회의 커널 평가를 수행했습니다. 최적화 과정은 단순한 운이 아니라, 다음과 같은 다섯 가지의 뚜렷렷한 구조적 전환을 포함하는 지속적인 노력이었습니다:\n\n1. Split-KV Parallelism: 커널을 재설계하여 KV-cache를 여러 스레드 블록으로 나누는 방식입니다.\n2. Overhead Removal: 동기식 cudaMalloc/cudaFree를 사전 할당된 텐서로 교체하는 방식입니다.\n3. Adaptive Tuning: SM 점유율을 최대화하기 위해 작업 부하 크기에 따른 휴리스틱을 구현하는 방식입니다.\n4. Reduction Optimizations: 레지스터 기반 로딩과 배치 소프트맥스 업데이트로 전환하는 방식입니다.\n5. Specialized MTP Kernel: 네 개의 쿼리 토큰을 동시에 처리하기 위한 최종적인 아키텍처 재설계입니다.\n\n그 결과, 참조 구현체 대비 10.0x 기하 평균 속도 향상을 달성했으며, 이는 GLM 5.1(7.3x) 및 DeepSeek V4 Pro(3.3x)를 훨씬 뛰어넘는 수치입니다.\n\n## 아키텍처 혁신: 환경 스케일링 및 일반화\n\nQwen3.7-Max의 능력은 Environment Scaling 전략에 의해 구동됩니다. LLM이 다양한 텍스트로부터 일반화하는 방식과 유사하게, Qwen 팀은 에이전트적 능력이 다양한 훈련 환경으로부터 일반화된다는 것을 발견했습니다.\n\n모델이 특정 벤치마크를 단순히 "기억"하는 것을 방지하기 위해, 팀은 Tasks, Harnesses, and Verifiers가 서로 직교하는 분리된 인프라를 활용했습니다. 이를 통해 모델은 서로 다른 harness 구성 하에서 동일한 작업을 수행하게 되며, 이는 특정 프레임워크의 지름길을 이용하는 대신 일반적인 문제 해결 전략을 학습하도록 강제합니다. 이러한 "교차 harness 일반화"는 Qwen3.7-Max가 Claude Code, OpenClaw, 또는 Qwen Code를 통해 배포되더라도 일관된 성능을 발휘하도록 보장합니다.\n\n## 커뮤니티 반응 및 비판적 관점\n\n기술적 벤치마크는 인상적이지만, Hacker News 커뮤니티에서는 모델의 배포 및 투명성에 대해 몇 가지 비판적인 점을 제기했습니다:\n\n* 벤치마크 투명성: 일부 사용자들은 벤치마크가 Qwen을 경쟁사의 약간 오래된 버전(예: Opus-4.6)과 자주 비교한다는 점을 지적하며, 왜 최신 버전이 항상 포함되지 않는지에 대해 의문을 제기했습니다.\n* 지정학적 및 윤리적 우려: 토론의 상당 부분은 모델의 출처에 집중되었습니다. 사용자들은 데이터 텔레메트리 및 정치적으로 민감한 정보, 특히 중국 정부 역사에 대한 검열 가능성에 대해 우려를 표했습니다.\n* 접근성: Alibaba Cloud Model Studio의 온보딩 과정에서 마찰이 발생한다는 보고가 있으며, 일부 사용자는 복잡한 리다이렉트 루프와 랜딩 페이지에서의 높은 CPU 사용량을 언급했습니다.\n\n## 통합 및 배포\n\nQwen3.7-Max를 통합하려는 개발자들을 위해, 모델은 문맥을 유지하기 위해 에이전트 작업에 매우 권장되는 preserve_thinking 기능을 지원합니다. 이 모델은 다음과 같은 주요 프레임워크와 호환됩니다:\n\n* Claude Code: 직접 통합을 위한 Anthropic API 프로토콜을 지원합니다.\n* OpenClaw: Model Studio를 통해 연결 가능합니다.\n* Qwen Code: Qwen 시리즈에 최적화되어 있습니다.\n\n최첨단 수준의 추론 능력과 장기적 자율 실행 능력을 결합함으로써, Qwen3.7-Max는 단순한 보조를 넘어 독립적이고 전문적인 수준의 프로덕션 영역으로 진입할 수 있는 AI 에이전트를 향한 중요한 진전임을 나타냅니다.