Qwen3.8-2.4T-A95B リリースノート

Qwen3.8-2.4T-A95B は Qwen-Max クラスの能力をオープンリリースにもたらします

Qwen3.8-2.4T-A95B は、Qwen オープンモデルファミリーの中で最も有能な世代であり、コーディング、専門的な研究、および長期的なエージェントタスクにおいて大幅な向上を実現します。Qwen3.5 のアーキテクチャ基盤に基づいて構築されたこのモデルは、複雑で多段階のタスクを高い信頼性とより強力な自律的な計画能力で処理するように設計されています。

モデルアーキテクチャと仕様

Qwen3.8-2.4T-A95B は、総パラメータ数と推論効率のバランスをとるために Mixture of Experts (MoE) アーキテクチャを利用する Causal Language Model です。

コア技術仕様

  • Total Parameters: 2.4 Trillion
  • Activated Parameters: 95 Billion
  • Number of Layers: 92
  • Hidden Dimension: 8192
  • Mixture of Experts: 合計 512 個のエキスパート、1 トークンあたり 10 個のルーティングされたエキスパートと 1 個の共有エキスパートがアクティブになります。
  • Expert Intermediate Dimension: 2048
  • Context Length: ネイティブで 262,144 トークン、最大 1,010,000 トークンまで拡張可能。
  • Vocabulary Size: 248,320 (padded)。

アーキテクチャのレイアウト

このモデルは 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) という隠れレイアウトを採用しています。Gated DeltaNet では V 用に 128 個の線形アテンションヘッド、QK 用に 16 個のアテンションヘッドを備え、Gated Attention では Q 用に 64 個、KV 用に 4 個のアテンションヘッドを備えています。

パフォーマンス・ベンチマーク

Qwen3.8-Max (このモデルに基づく公式バージョン) は、Claude Opus 4.8、Fable 5、および GPT-5.6 Sol といった最先端モデルに対して競争力のあるパフォーマンスを示しています。

コーディングとエージェント性能

Qwen3.8-Max は、Qwen3.7-Max と比較して、特にソフトウェアエンジニアリングのベンチマークにおいて大幅な改善を示しています:

  • Terminal Bench 2.1: 86.6 (vs. 74.5 for Qwen3.7-Max)
  • FrontierSWE: 73.5 (vs. 40.7 for Qwen3.7-Max)
  • PaperBench: 93.0 (GPT-5.6 Sol の 90.5 をリードしてグループのトップに立つ)
  • AndroidBench: 75.1 (vs. 56.5 for Qwen3.7-Max)

一般的な能力

  • GPQA Diamond: 92.6、Fable 5 と同等であり、Opus 4.8 (92.0) を上回ります。
  • IFBench: 82.8、GPT-5.6 Sol (72.7) と Fable 5 (63.5) を上回ります。
  • MRCR v2 256K (8-needle): 92.9、強力な長期コンテキスト検索能力を示しています。

デプロイメントと API 使用法

サービング・フレームワーク

Qwen3.8 は、いくつかの高スループット推論エンジンと互換性があります:

  • SGLang
  • vLLM
  • TokenSpeed

API 設定と推論制御

Qwen3.8-2.4T-A95B は、すべてのインタラクションにおいて「思考モード」を必要とするテキストのみのモデルです。すべてのレスポンスは <think> タグで囲まれた推論から始まります。

ユーザーは reasoning_effort パラメータを介して推論の深さを制御できます:

  • xhigh (Default): 徹底的な分析を必要とする複雑なタスク用。
  • medium: 精度と速度のバランス。
  • low: 速度とコストに最適化。

推奨されるサンプリング・パラメータ

最適な結果を得るために、以下のサンプリング設定が推奨されます:

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

コミュニティの洞察と技術的な考慮事項

コミュニティの議論では、オープンウェイト版と管理型 Qwen3.8-Max サービスとの間のいくつかの重要なトレードオフが強調されています。

ハードウェア要件と量子化

2.4T パラメータ数เนื่องจาก its 2.4T parameter count, the full BF16 モデルは、サイズが約 4.9TB と推定されます。コミュニティのメンバーは、量子化なしでこのモデルをサービングすることは、ほとんどのユーザーにとって非常に高価であると指摘しています。

"The dt 1bit quant model is at an astonishing 397GB... This literally puts Opus 4.5 performance level into a machine a normal person could buy。"

機能の差異

ユーザーは、オープンウェイト版には、管理型 Qwen3.8-Max バージョンに存在するいくつかの機能が欠けてれていることが指摘しています。これには以下が含まれます:

  • Vision Support: オープンウェイトモデルはテキストのみです。
  • Context Window: オープンウェイト版は 250k トークンに制限されていますが、管理型バージョンはデフォルトで 1M トークンをサポートしています。
  • Non-thinking support: 管理型バージョンは、必須の推論フェーズなしでのレスポンスを可能にします。

ライセンス

このモデルは、内部使用、または年間売上高が 5000 万ドル未満の組織向けに無料です。このしきい値を超える組織、特にコーディングや生産性エージェントを対象とするサービスについては、制限が適用されます。

Sources

関連

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch