Qwen3.7-Plus 릴리즈 노트 / 새로운 소식

Qwen3.7-Plus: 통합 멀티모달 에이전트 기반

Qwen3.7-Plus는 비전과 언어를 하나의 기반으로 통합한 멀티모달 에이전트 모델로, 멀티모달 인터랙티브 하이브리드 에이전트로 작동할 수 있습니다. 실제 장면을 인식하고, GUI를 조작하며, 시각적 레퍼런스로부터 코드를 작성하고, 모바일 애플리케이션을 엔드‑투‑엔드로 탐색하도록 설계되었습니다. GUI와 CLI 상호작용을 하나의 에이전트 루프 안에서 매끄럽게 결합합니다.

멀티모달 인터랙티브 하이브리드 에이전트 기능

Qwen3.7-Plus는 "보고, 생각하고, 쓰고, 행동하고, 검증한다"는 워크플로를 통합해 복잡한 소프트웨어 작업을 자동화합니다.

엔드투엔드 소프트웨어 개발

Qwen3.7-Plus 기반의 Hybrid‑Agent 시스템을 활용해 팀은 영어 어휘 학습 앱의 R&D 사이클을 완전 자동화했습니다. 에이전트는 11시간 이상 작동하면서 10,000줄이 넘는 코드를 생성하고 1,000회가 넘는 에이전트 호출을 트리거했습니다. 이 과정에는 요구사항 문서 생성, 자동 코딩, 배포, 테스트 케이스 작성, GUI 기반 자동 테스트, 그리고 자율적인 버전 진화가 포함되었습니다.

전문 애플리케이션 복제

이 모델은 전문 데스크톱 애플리케이션을 자율적으로 복제할 수 있습니다. 한 사례에서는 원본 macOS Stocks 앱과 상호작용해 UI 레이아웃을 파악하고, SwiftUI 소스 코드를 생성하며, LongBridge 마켓 API를 통합해 실시간 데이터를 제공하고, 10개의 자율 기능 검증 테스트를 모두 통과하는 고충실도 버전을 재현했습니다.

브라우저 자동화

Qwen for Chrome 확장을 통해 Qwen3.7-Plus는 Browser Agent 역할을 수행합니다. 웹 페이지를 인식하고 클릭, 입력, 탐색 등을 수행해 복잡한 워크플로를 완수합니다. 예를 들어 클라우드 콘솔에서 가장 저렴한 ECS 서버를 구매하는 과정에서 가격 변동이나 재고 제한에 따라 동적으로 조정합니다.

기술 성능 및 벤치마크

텍스트 및 일반 에이전트 성능

Qwen3.7-Plus는 Max‑tier 모델에 근접하는 경쟁력 있는 텍스트 성능을 제공합니다. 주요 벤치마크 결과는 다음과 같습니다:

  • Coding Agents: Terminal Bench 2.0 (70.3), SWE‑bench 시리즈, SciCode (51.3)에서 강력한 성능을 보임.
  • General Agents: MCP‑Mark (58.7)와 Deep‑Planning (62.3)에서 견고한 도구 사용 및 계획 능력을 보이며, Kernel Bench L3에서 GPU 커널 최적화(2.06 배 가속 / torch.compile보다 98% 빠름)에서 특히 강함.
  • STEM & Reasoning: GPQA Diamond (90.3), HMMT (92.9), IMOAnswerBench (86.0)에서 높은 성능을 기록.

멀티모달 추론 및 이해

Qwen3.7-Plus는 시각 에이전트 역량에서 체계적인 향상을 보여줍니다:

  • Multimodal Reasoning: BabyVision (70.4/64.7), MathVision (90.3), HiPhO (84.1)에서 큰 향상을 보이며, 공간 관계와 물리적 상식 통합 능력을 보여줌.
  • Visual Agent & Coding: ScreenSpot Pro (79.0), OSWorld‑Verified (73.3), AndroidWorld (81.0)에서 큰 개선을 보임. QwenVision2Code에서는 1772.0 점수를 달성해 디자인 레퍼런스를 실행 가능한 코드로 변환하는 능력을 나타냄.
  • Multimodal Search & Knowledge QA: SimpleVQA (81.7)와 WorldVQA (61.1)에서 시각 입력과 외부 검색 보강을 결합해 향상됨.
  • General Visual Understanding: 문서 파싱(OmniDocBench 1.5: 91.4)과 OCR(OCR‑Bench‑V2 ZH: 67.1)에서 강력한 성능을 보임.

비디오 및 주행 장면 이해

모델은 비디오의 시간적 동역학과 의미 관계를 추론하여 VideoMMMU (85.4)와 TVBench (78.2)에서 높은 점수를 기록했습니다. 자율 주행 시나리오에서는 LingoQA (83.4)와 SURDS (77.2)에서 공간 관계 이해를 보여줍니다.

비주얼 에이전트 도구 통합

Qwen3.7-Plus는 시각 이해와 프로그래밍 문제 해결을 결합합니다:

  • Code Interpreter Integration: 모델은 이미지를 분석해 슬라이딩 블록 퍼즐을 풀고, 미로를 탐색하며, 퍼즐 조각을 조립하는 등 코드를 자동으로 생성·실행해 문제를 해결함.
  • Vision-to-Code Generation: 이미지, 비디오, UI 스크린샷을 실행 가능한 코드로 변환하며, SVG 재구성 및 시각 레퍼런스로부터 전체 인터랙티브 웹페이지 생성까지 수행함.

배포 및 프레임워크 호환성

Qwen3.7-Plus는 Alibaba Cloud Model Studio를 통해 제공되며, OpenAI 사양과 호환되는 산업 표준 프로토콜을 지원합니다. preserve_thinking 기능을 포함해 턴 간 사고 내용을 유지할 수 있으며, 에이전트 작업에 권장됩니다.

모델은 다양한 에이전트 스캐폴드에 일반화되며 다음과 호환됩니다:

  • Claude Code: Anthropic API 프로토콜을 지원.
  • OpenClaw: Model Studio를 통해 연결.
  • Qwen Code: Qwen 시리즈에 깊게 최적화됨.

Sources