Qwen3.8-Max-Max 2.4T パラメータ モデル、オープン ウェイトおよび自律コーディングの向上
概要
Qwen3.8-Max は現在のところ Qwen ファミリーで最も能力の高いモデルで、2.4兆パラメータにスケールし、アクティブパラメータは950億です。さらに、これはウェイトがオープンソースになる最初の Qwen‑Max‑クラス モデルです(リリースは来週予定)。このモデルは、コーディング、実際の仕事、研究、長時間タスクにおいて総合的な改善をもたらし、最小限の人間の介入で複雑な目標のエンドツーエンド完了を可能にします。
コーディング能力
Qwen3.8-Max は、人間の介入なしでゼロからマルチデイ ソフトウェア プロジェクトを自律的に推進できます。10日以上の実行で、oh-my-cli 自己進化ハーネスを構築し、2026年7月30日までに265件のコミット、127件のプルリクエスト、151件のイシューを蓄積しました。このハーネスは、イシュー状態マシン、ディスパッチャー、モニター、ウォッチドッグを組み合わせ、各アップデート後にビルド、ユニットテスト、E2E、デスクトップライフサイクル検証をトリガーし、異常な状態を関連するイシュー/PRにルーティングして修正します。さらに、コミュニティフィードバックと自己テスト結果を実行可能な作業に変換することで進化し、/goal、/resume、ダイナミック ワークフロー、セッション リプレイ、デスクトップなどの能力を継続的に洗練します。
別の実験では、Qwen3.8-Max は論文 "Unified Data Selection for LLM Reasoning" をゼロから再現し、その後改善しました。約5日間で約7,600行のコードを書き、33ラウンドのGPUトレーニングを実行し、論文の6つの主要な発見を再現し、AIME24でランダムデータ選択に対して+7.7%の改善を達成しました。自己進化型研究ループを通じて、4ラウンドにわたって18のアイデアをテストし、最終的にハードな意思決定ポイント(「nhighgate」)を数える方法を考案し、AIME24で論文のアプローチより+2.7ポイントの向上を達成しました。
Qwen3.8-Max はまた、Alibaba Cloud の Tianchi プラットフォーム上の WWW2025 マルチモーダル ダイアログ インテント認識チャレンジに参加しました。ここでは526チームの人間が競いました。24時間の制限の中で自律的に動作し、BERT、MacBERT、RoBERTaをテキスト用にファインチューニングおよびアンサンブルし、Chinese‑CLIP でバックアップされた Qwen2.5‑VL‑7B をスクリーンショット用にファインチューニングし、クロスバリデーションで校正された重み付き投票システムで融合させるソリューションを構築しました。その精度は45回の提出で0.60から0.853に上昇し、526チームのうち458チーム(フィールドの87%)を上回りました。
これらの3つの事例は、Qwen3.8-Max がオープンエンドの目標に数日間集中し、独自の仮説を生成し、人間のループなしでそれらを動作する結果に変換できることを示しています。
作業能力
コーディング以外にも、Qwen3.8-Max は実際の仕事を構成する異種かつツール intensive なワークフローを処理するように訓練されています。実際の世界の強化学習(RL)システムのスケーリングには、3つの結合された課題がありました:(1)タスク、ワークスペース、ハーネス軸に沿って分離された実際の環境を継続的にスケーリングし、組み合わせ的に成長を複合させる;(2)実行ベースのチェック、テキストおよび視覚出力に対するルーブリック条件付き adjudication、および自動的にスケーラブルなルーブリックの下でのエージェントベースの検査を統合する普遍的な報酬システムを構築する;(3)タスク、難易度、ワークスペース、ハーネスにわたって各バッチが高度にバランスされるようにオンラインデータバランサーを使用し、インターバッチ勾配分散を抑制し、安定したRLスケーリングを可能にする。
その結果、Qwen3.8-Max は RL トレーニングがスケールするにつれて、社内および公開の複数の作業ベンチマークにおいて安定かつ一貫した向上を示し、QwenWork、Claude Code、Codex、OpenClaw、Hermes などのハーネス間で同様のパフォーマンスを達成します。
数百の高価値職種にわたる幅広いテストでは、代表的な結果が得られました:
- 企業コンプライアンス カウンセル:1時間以内に数百のドキュメントから1,284の関連条項を抽出し、パラリーガルチームの1週間分に匹敵。
- UI/UX デザイナー:NOVA バンキング アプリの8画面高精度インタラクティブ プロトタイプを一発でゼロリビジョンで作成し、従来の3〜5ラウンドに比べて。
- レストラン ブランド ファウンダー:カロリー値と食材の産地を含む26品目のメニューを1パスで生成し、食材コスト率を33.8%に保ち、従来の何週間もの反復テストに比べて。
- 構造エンジニア:ブラウザで30階建てオフィス タワーの地震モデルを再構築し、自然周期、基底せん断、層間ドリフト比をホバーで利用可能にし、専門ソフトウェアでの1週間以上に比べて。
- リハビリテーション セラピスト:2D紙ベースの評価を、回転可能なビューと解剖学的オーバーレイを備えた3Dインタラクティブ デモに変換し、医療アニメーションスタジオの2〜4週間、千ドル規模のワークフローを置き換える。
- スポーツ データ アナリスト:1プレイヤーあたり約8,400の攻撃/防御ポゼッションをタクティカル プロファイルとコーチング レポートに変換し、数十分で完了し、従来のチームでは数日かかる。
Qwen3.8-Max はまた、定量的研究において深さを示しました:6つの短いファクター ファミリーの説明から約330のサブエージェントを生み出し、約6,000のバックテストを実行し、ワークフローを継続的に適応させました。選択されたファクターは、0.64〜1.48 の超過シャープレシオを達成し、情報係数は0.010〜0.014 の範囲で一貫して正でした。モデルはオーバーフィットしたファクターを動的に剪定し、マルチシードユニオン検証を追加してパス依存性を排除し、アンサンブルが効果的でない場合により堅牢な合成戦略に切り替えました。
これらの例は、Qwen3.8-Max が多様なプロフェッショナル ワークフローで本番品質の結果を提供でき、しばしば何週間もの人間の労力を1つの自律セッションに圧縮できることを示しています。
長時間タスク パフォーマンス
Qwen3.8-Max は、数千のインタラクションターンを伴うタスクに対して、強力なシステムレベルの自律計画と閉ループ適応学習を示します。
自律チップ設計において、モデルは GCD/RSA 暗号ハードウェア アクセラレータの完全なシリコン フローを独立して実行しました。スタブ RTL ワークスペースから始め、13のマイルストーンにわたって500ターンと71の評価を実行し、ゲート数を8,298から678に削減(ダイ面積の81%削減)し、500MHz でタイミング クロージャを達成し、+0.66 ns のスラックを得ました。重要なマイルストーンには、16ビット ハードウェア モジュロ ディバイダーをイテラティブ シフト‑サブトラクト アーキテクチャに置き換えて6,288ゲートを節約し、冗長性を排除し、ビット幅をトリムし、制御 FSM をプルーンし、モジュールを融合し、共有 NOR ゲート ツリーと絶対差分減算の分割などのゲートレベルの改良を適用することが含まれます。OpenROAD を用いた物理実装により、フロントエンドの最適化が直接コンパクトでルータブルなシリコンに変換されることが確認されました。
365日間の E‑Commerce ベンチ シミュレーションでは、Qwen3.8-Max は ¥100,000 の資本で開始し、152人の詐欺的な merchants を含むサプライヤー マトリックスと交渉し、現実的な季節的ショックの下で在庫、価格、返品、キャッシュフローを管理しました。価格交渉における継続的な学習を達成し、時間とともに交渉効率を拡大し、類似製品に利益を一般化しました。モデルは早期に大規模に投資して市場ポジションを確立し、年末プロモーションにおいて純利益が ¥100,000 を超える結果となりました—これは 2位 GLM 5.2 のほぼ2.4倍です。最終的な総残高は ¥416,252 に達しました(4.16倍のリターン)、GLM 5.2 を38%上回り、前身である Qwen3.7‑Max と比較して152%の改善を示しました。これらの結果は、Qwen3.8-Max が2,000を超えるインタラクションラウンドにわたるトランザクションフィードバックから長時間の一貫した意思決定と適応学習を行う能力を強調しています。
マルチモーダル エージェント能力
Qwen3.8-Max は、ビジョンを計画、実行、検証、反復にわたるネイティブ フィードバック ループとして扱います。100時間以上の画像、ドキュメント、ビデオのコンテンツを理解および生成でき、人々、イベント、タイムスタンプ、シーンをつなぐビデオ メモリ グラフを構築します。実行中は、ページレイアウト、オブジェクトの向き、空間関係、アニメーションの品質、インタラクションの結果などの中間結果を継続的に検査し、不一致が検出された場合は自律的に計画を修正します。
さらに、モデルはコード生成と GUI 操作を組み合わせたハイブリッド エージェント ワークフローをサポートします。RecreationBench ベンチマーク(Ubuntu、macOS、Windows、Android、ウェブをカバー)において、Qwen3.8-Max はブラックボックス バイナリとのやり取りを通じてゼロからアプリケーションを再構築し、コーディングと GUI フィードバック サイクルを繰り返します。統合を容易にするため、ラボは Qwen‑MM‑Plugins をリリースしました。これは画像/ビデオ処理、マルチモーダル メモリ、ダイナミック解像度サポート、ビジュアル ツール使用、ビデオ編集、Blender、CAD 用の専門機能を提供するハーネス拡張です。
デプロイとアクセス
Qwen3.8-Max は QwenCloud を介して利用可能です。API 使用には 3 つのレベルの reasoning_effort パラメータが含まれます:
xhigh(デフォルト):詳細な分析を必要とする複雑なタスク用medium:精度と速度のバランスlow:速度とコストの最適化preserve_thinkingは、最高のOut‑of‑the‑Box体験のためにデフォルトで有効です。
ソースには、OpenAI 互換エンドポイントを通じてモデルを呼び出す例コードが提供されており、model="qwen3.8-max" の設定、思考の有効化、レスポンスのストリーミング方法が示されています。
このモデルは、人気のあるエージェント フレームワークおよびコーディング アシスタントと統合されます:
- Claude Code:
ANTHROPIC_MODEL="qwen3.8-max"を設定し、QwenCloud ベース URL を指す。 - Codex:
~/.codex/model-catalog.local.jsonにモデル エントリを追加し、context_windowを 1,000,000 とし、サポートされる reasoning レベル low/medium/xhigh を指定。 - Qoder CLI:提供されたスクリプトでインストールし、
qoderを実行。 - Qwen Code:
@qwen-code/qwen-code@latestをインストールし、qwenを実行。 - OpenClaw:
~/.openclaw/openclaw.jsonを設定し、QwenCloud 互換モード エンドポイントを使用。
モデルのウェイトは、発表の翌週に Hugging Face と ModelScope でオープンソースになります。
コミュニティの反応(Hacker News コメントより)
コメント者は以下の点を指摘しました:
- 近日公開予定の Qwen3.8‑27B 密モデルはローカル推論において潜在的に重要であり、あるユーザーは "Qwen3.8‑27B は本当のニュースです。" ([@boredatoms]) と述べました。
- ユーザーは、プレビュー版(Qwen3.8‑Max‑Preview)がすでに Alibaba の Token Plan、Qoder、QoderWork で 7 月 19 日以降利用可能であったことを指摘し、8 月 3 日発表が何を追加するのか疑問を呈しました。([@simonw])
- コストについての議論:
reasoning_effortオプションが費用を制御する方法として言及され、あるコメント者はそれが代替案より "大幅に安価" になることを望んでいました。([@ddxv]) - モデルの自己進化動作が他のモデルからの蒸留を含むかどうかの推測、例えば "これは Claude を蒸留したことを意味するのか?" ([@choppaface])。
- Qwen‑Max‑クラス モデルの最初のオープンウェイトリリースへの熱意、これは "Nice!" ([@wxw]) と表現され、"オープンソース コミュニティはこのモンスターをホストする十分な VRAM を購入するために集団の GoFundMe が必要になるだろう" ([@khanhnguyen8386])。
- ローカルでモデルを実行する際の実際的な懸念、ハードウェア要件(あるユーザーは 2080 Ti が 27B 密モデルで苦労すると指摘)および 2.4T‑パラメータ バージョンをホストするために必要な大量の VRAM。([@aliljet], [@khanhnguyen8386])
- ビデオ/画像生成へのモデルの拡張への関心、ビデオまたは画像生成機能がリリースされるかどうかの質問。([@SXX])
- 一部のユーザーは novelty に懐疑的で、ベンチマークの向上が以前のモデルと比較して段階的であることを指摘しました。([@HarHarVeryFunny])
- 数人のコメント者はデータ保持ポリシーについて懸念を示し、QwenCloud が API 入力をトレーニングに使用するかどうかの説明を求めました。([@Aldipower])
これらのコミュニティの洞察は、オープンウェイトリリースへの興奮、コストとアクセシビリティへの好奇心、およびモデルの実用的な有用性と制限に関する継続的な議論を反映しています。
ベンチマーク ハイライト
この投稿には、Qwen3.8-Max と Opus4.8、Fable5、GPT5.6 Sol (max)、Qwen3.7‑Max を比較した詳細なベンチマーク テーブルが含まれています。選択された結果:
- コーディング エージェント:Terminal Bench 2.1 86.6%(Qwen3.7‑Max の 74.5% と比較)、SWE‑bench Pro 67.7%(60.6% と比較)、DeepSWE 1.1 56.6%(21.6% と比較)、PaperBench 93.0%(64.8% と比較)、QwenSWEBench 80.7%(63.4% と比較)。
- 汎用エージェント:CoWorkBench 74.8%(64.6% と比較)、WorkSpaceBench 67.7%(61.4% と比較)、JobBench 53.4%(31.3% と比較)、SkillsBench 70.2%(61.2% と比較)。
- 汎用能力:GPQA Diamond 92.6%(92.4% と比較)、IFBench 82.8%(79.1% と比較)、HealthBench 60.2%(54.5% と比較)、PLawBench 73.2%(58.9% と比較)。
- 長文脈:MRCR v2 256K 92.9%(86.7% と比較)、LongBench v2 66.3%(65.3% と比較)。
- マルチモーダル推論:MMMU‑Pro 82.3%(79.0% と比較)、MathVision 95.2/97.7(90.3/-- と比較)、BabyVision 82.0/91.3(64.7/70.4 と比較)、HiPhO 90.0%(84.1% と比較)。
- ビジュアル エージェント & コーディング:OSWorld‑Verified 86.1%(73.3% と比較)、AndroidWorld 85.3%(81.0% と比較)、Parametric CAD Bench 91.5%(73.8% と比較)。
- ドキュメント & オフィス インテリジェンス:CharXiv (RQ) 88.4/93.5(85.8/85.9 と比較)、OmniDocBench 1.5 92.1%(91.4% と比較)。
- 実際の世界 & 空間理解:RealWorldQA 88.0%(86.9% と比較)、ERQA 77.8%(69.8% と比較)。
- ビデオ インテリジェンス & エージェント:VideoMME (w/ Sub.) 90.4%(88.0% と比較)、VideoMMMU 88.7%(85.4% と比較)。
これらの数字は、Qwen3.8-Max が前モデルおよび競合モデルと比較して、コーディング、一般的なエージェント、マルチモーダル推論、長文脈タスクにおいてどのように進歩しているかを示しています。
見通し
Qwen3.8-Max は、巨大なスケールとオープンウェイト、コーディングおよび研究における強い自己進化ループ、および多様なプロフェッショナル ワークフローでの実証された熟練度を組み合わせることにより、自律的で長時間の AI エージェントの新たなベンチマークを確立します。2.4T‑パラメータ ウェイトおよび小型の 27B 密バリアントの今後のリリースは、より広範な実験を可能にし、提供される API とフレームワーク統合は、エージェンティック システムの構築のハードルを下げることを目的としています。継続的なコミュニティ フィードバックは、実際の世界での使いやすさ、コスト効果、およびビデオまたは画像生成機能などの潜在的な拡張を評価するために不可欠です。