Qwen3.7-Plus リリースノート / 新機能
Qwen3.7-Plus: 統合マルチモーダルエージェント基盤
Qwen3.7-Plus は、視覚と言語を単一の基盤に統合したマルチモーダルエージェントモデルで、マルチモーダルインタラクティブハイブリッドエージェントとして動作します。実世界のシーンを認識し、GUI を操作し、視覚的参照からコードを書き、モバイルアプリケーションをエンドツーエンドでナビゲートでき、GUI と CLI の相互作用をシームレスに単一のエージェントループ内で融合させます。
マルチモーダルインタラクティブハイブリッドエージェント機能
Qwen3.7-Plus は "see, think, write, act, and verify" のワークフローを統合し、複雑なソフトウェアタスクを自動化します。
エンドツーエンド ソフトウェア開発
Qwen3.7-Plus をベースにした Hybrid-Agent システムを使用して、チームは英語語彙学習 APP の R&D サイクルを完全に自動化したことを実証しました。エージェントは 11 時間以上稼働し、10,000 行以上のコードを生成し、1,000 回以上のエージェント呼び出しをトリガーしました。このプロセスは要件文書の生成、コードの自動生成、デプロイ、テストケース作成、GUI ベースの自動テスト、そして自律的なバージョン進化を網羅しました。
プロフェッショナルアプリケーションの再現
このモデルはプロフェッショナルなデスクトップアプリケーションを自律的に再現できます。あるケースでは、macOS のネイティブ Stocks アプリを高忠実度で再現し、元アプリと対話して UI レイアウトを把握し、SwiftUI ソースコードを生成し、LongBridge 市場 API を統合してライブデータを取得し、10 の自律的機能検証テストに合格させました。
ブラウザ自動化
Qwen for Chrome 拡張機能を通じて、Qwen3.7-Plus は Browser Agent として機能します。ウェブページを認識し、クリック、入力、ナビゲーションを実行して複雑なワークフローを完了します。例として、クラウドコンソール上で最安の ECS サーバーを購入する際に、価格変動や在庫制限に応じた動的調整を行います。
技術的パフォーマンスとベンチマーク
テキストおよび汎用エージェントのパフォーマンス
Qwen3.7-Plus は Max-tier モデルに匹敵する競争力のあるテキスト性能を提供します。主なベンチマーク結果は以下の通りです。
- Coding Agents: Terminal Bench 2.0 (70.3)、SWE-bench シリーズ、SciCode (51.3) で高い性能を示します。
- General Agents: MCP-Mark (58.7) と Deep-Planning (62.3) におけるツール使用と計画能力が堅牢で、Kernel Bench L3 では GPU カーネル最適化で 2.06 倍のスピードアップ(torch.compile より 98% 高速)を実現します。
- STEM & Reasoning: GPQA Diamond (90.3)、HMMT (92.9)、IMOAnswerBench (86.0) で高性能を発揮します。
マルチモーダル推論と理解
Qwen3.7-Plus は視覚エージェント機能に体系的な向上を示します。
- Multimodal Reasoning: BabyVision (70.4/64.7)、MathVision (90.3)、HiPhO (84.1) で大幅な伸びを示し、空間関係と物理的常識の統合能力を実証します。
- Visual Agent & Coding: ScreenSpot Pro (79.0)、OSWorld-Verified (73.3)、AndroidWorld (81.0) で顕著な改善を示します。QwenVision2Code ではスコア 1772.0 を取得し、デザイン参照を実行可能なコードに変換できることを示しています。
- Multimodal Search & Knowledge QA: SimpleVQA (81.7) と WorldVQA (61.1) で、視覚入力と外部検索強化を組み合わせた改善が見られます。
- General Visual Understanding: 文書解析 (OmniDocBench 1.5: 91.4) と OCR (OCR-Bench-V2 ZH: 67.1) で強力な性能を示します。
ビデオおよび運転シーンの理解
モデルはビデオ内の時間的ダイナミクスと意味的関係を推論し、VideoMMMU (85.4) と TVBench (78.2) で高得点を獲得しています。自律走行シナリオでは、LingoQA (83.4) と SURDS (77.2) において空間関係の理解を示します。
ビジュアルエージェントツール統合
Qwen3.7-Plus は視覚理解とプログラム的問題解決を組み合わせます。
- Code Interpreter Integration: 画像を分析してスライディングブロックパズルを解き、迷路をナビゲートし、ジグソーパズルを組み立てるために、コードを自律的に生成・実行できます。
- Vision-to-Code Generation: 画像、ビデオ、UI スクリーンショットを実行可能なコードに変換し、SVG 再構築や視覚参照からの完全なインタラクティブウェブページ生成を行います。
デプロイとフレームワーク互換性
Qwen3.7-Plus は Alibaba Cloud Model Studio で利用可能で、OpenAI の仕様と互換性のある業界標準プロトコルをサポートします。preserve_thinking 機能を備えており、ターン間で思考内容を保持でき、エージェントタスクに推奨されます。
モデルは多様なエージェントスキャフォールドに汎用化でき、以下と互換性があります。
- Claude Code: Anthropic API プロトコルをサポート。
- OpenClaw: Model Studio 経由で接続。
- Qwen Code: Qwen シリーズ向けに深く最適化。