Qwen3.8-Max リリースノート / 新機能

Qwenは、Qwen3.8-Maxのリリースを発表しました。これは現在までのQwenファミリーで最も能力の高いモデルです。2.4兆パラメータ(アクティブは95B)にスケールし、このモデルは複雑でオープンエンドな目標をエンドツーエンドで処理するように設計されており、特に自律コーディング、プロフェッショナルリサーチ、長時間タスク実行の改善をターゲットとしています。

自律コーディングと自己進化

Qwen3.8-Maxは、単純な関数生成から自律プロジェクト管理へと移行します。このモデルは、フィードバックループを通じて自己進化する能力を示しており、これは3つの主要なテストケースによって裏付けられています:

  • Self-Evolving Harness: 10日以上の自律実行において、モデルはoh-my-cliプロジェクトをゼロから構築しました。イシュー状態マシン、ディスパッチャー、ウォッチドッグを含むループを実装し、コミュニティフィードバックを実行可能な作業に変換しました。16日後、リポジトリは265件のコミット、127件のPR、151件のイシューを蓄積しました。
  • Research Reproduction and Improvement: モデルは、「Unified Data Selection for LLM Reasoning」論文をゼロから再現しました(125時間で7,600行のコードを作成)。その後、元の論文のアプローチを上回る新しい手法に進化させ、AIME24ベンチマークで+2.7ポイントの向上を達成しました。
  • Competitive Programming: WWW2025マルチモーダルダイアログインテント認識チャレンジにおいて、Qwen3.8-Maxは526チームの人間と競いました。24時間以内に自律的に作業し、精度0.853を達成し、人間参加者の87%を上回りました。

プロフェッショナルワークフロー統合

一般的な作業能力を向上させるため、QwenはQwenWork、Claude Code、Codexを含むいくつかのハーネスでRL環境と計算をスケールしました。これは、実行ベースのチェックとエージェントベースの検査を統合する普遍的な報酬システムによって達成されました。

高価値プロフェッショナルパフォーマンス

Qwen3.8-Maxは、本番品質の結果を提供するために数百の職業でストレステストを行いました:

  • Legal: 1時間未満で何百ものドキュメントのコンプライアンスレビューを完了しました。これは通常、パラリーガルチームが1週間かかる作業です。
  • UI/UX Design: 人間の修正なしで一発で、銀行アプリの高 fidelity 8スクリーンインタラクティブプロトタイプを作成しました。
  • Engineering: 図面から30階建てオフィスビルの耐震構造モデルを再構築し、ベースシアーと階間ドリフトのリアルタイム検査を提供しました。
  • Medical: 2Dの紙ベースの評価を3Dインタラクティブな解剖学デモに変換し、リードタイムを週間から分に短縮しました。
  • Finance: エンドツーエンドのETFローテーション戦略を開発し、オーバーフィッティングを避けるために冗長な要因を自律的に剪定し、330のサブエージェントを介して大規模並列要因マイニングを実行しました。

長時間タスク実行

Qwen3.8-Maxは、数千ラウンドの相互作用を必要とするタスクを処理するために、アクションフィードバックイテレーションループを利用します。

自律チップ設計

このモデルは、GCD/RSA暗号ハードウェアアクセラレータの完全なシリコン設計フローを実行しました。参照設計がない場合、「edit-simulate-synthesize-layout」ループを使用して、設計を8,298ゲートから678ゲートに削減しました。最終的な物理レイアウトはダイ面積を81%削減し、500MHzでタイミングクロージャを達成しました。

E-Commerce シミュレーション

E-Commerce Bench(365日間のシミュレーション)において、Qwen3.8-Maxは複数の店舗を管理し、サプライチェーンの危機に対処し、ゲーム理論の原則に基づいてサプライヤーと交渉しました。総残高は¥416,252(4.16倍のリターン)を達成し、2位のモデル(GLM 5.2)を38%上回りました。

マルチモーダルインテリジェンスとハイブリッドエージェント

Qwen3.8-Maxは、タスクライフサイクル全体に視覚インテリジェンスを統合し、単純な画像理解から能動的な視覚フィードバックへと進化させます。

  • Visual Feedback Loops: モデルは自身の中間結果(例えば、ページレイアウトやアニメーション品質)を観察し、偏差を修正するために計画を自律的に修正できます。
  • Hybrid Agent Capability: コーディングとGUI操作を組み合わせることで、モデルはコードを介してロジックを実装しながら、ライブシステムに対して結果を検証できます。これはRecreationBenchでテストされ、そこでモデルはブラックボックス観察からアプリケーションを再構築しました。
  • Video Memory: 100時間を超えるビデオに対して、モデルはキャラクター、イベント、関係を長期間追跡するためのビデオメモリグラフを構築します。

技術仕様と可用性

  • Parameters: 2.4兆 (アクティブ95B)
  • Availability: 現在、QwenCloud経由で利用可能です。
  • Open Weights: 来週、Hugging FaceとModelScopeでオープンウェイトがリリースされる予定です。
  • API Features: reasoning_effort (xhigh, medium, low) をサポートし、深さとコストのバランスを取り、preserve_thinking をサポートして reasoning プロセスの透明性を確保します。

Sources