Qwen3.8-2.4T-A95B 發佈說明

Qwen3.8-2.4T-A95B 為開源版本帶來了 Qwen-Max 等級的能力

Qwen3.8-2.4T-A95B 是 Qwen 開源模型家族中最強大的世代,在程式碼編寫、專業研究和長程代理任務(long-horizon agentic tasks)方面提供了實質性的提升。該模型建立在 Qwen3.5 的架構基礎之上,旨在以高可靠性和更強的自主規劃能力來處理複雜的多步驟任務。

模型架構與規格

Qwen3.8-2.4T-A95B 是一個因果語言模型(Causal Language Model),利用混合專家架構(Mixture of Experts, MoE)來平衡總參數數量與推理效率。

核心技術規格

  • 總參數:2.4 Trillion
  • 激活參數:95 Billion
  • 層數:92
  • 隱藏層維度:8192
  • 混合專家架構:總共 512 個專家,每個 token 會激活 10 個路由專家和 1 個共享專家。
  • 專家中間層維度:2048
  • 上下文長度:原生支持 262,144 tokens,可擴展至 1,010,000 tokens。
  • 詞彙表大小:248,320 (padded)。

架構佈局

該模型採用 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) 的隱藏佈局。它在 Gated DeltaNet 中具有 128 個用於 V 的線性注意力頭和 16 個用於 QK 的線性注意力頭,並在 Gated Attention 中具有 64 個用於 Q 的注意力頭和 4 個用於 KV 的注意力頭。

性能基準測試

Qwen3.8-Max(基於此模型的官方版本)在面對 Claude Opus 4.8、Fable 5 和 GPT-5.6 Sol 等前沿模型時,展現了極具競爭力的性能。

程式碼編寫與代理性能

Qwen3.8-Max 在 Qwen3.7-Max 之上展現了顯著的改進,特別是在軟體工程基準測試中:

  • Terminal Bench 2.1:86.6 (對比 Qwen3.7-Max 的 74.5)
  • FrontierSWE:73.5 (對比 Qwen3.7-Max 的 40.7)
  • PaperBench:93.0 (領先群體,GPT-5.6 Sol 為 90.5)
  • AndroidBench:75.1 (對比 Qwen3.7-Max 的 56.5)

通用能力

  • GPQA Diamond:92.6,與 Fable 5 持平,並超越了 Opus 4.8 (92.0)。
  • IFBench:82.8,優於 GPT-5.6 Sol (72.7) 和 Fable 5 (63.5)。
  • MRCR v2 256K (8-needle):92.9,展現了強大的長上下文檢索能力。

部署與 API 使用

服務框架

Qwen3.8 兼容於多種高吞吐量推理引擎:

  • SGLang
  • vLLM
  • TokenSpeed

API 配置與推理控制

Qwen3.8-2.4T-A95B 是一個純文本模型,所有交互都需要「思考模式」。每個回應都以包含在 <think> 標籤中的推理過程開始。

用戶可以透過 reasoning_effort 參數來控制推理深度:

  • xhigh (預設):用於需要徹底分析的複雜任務。
  • medium:在準確度與速度之間取得平衡。
  • low:針對速度與成本進行優化。

建議的採樣參數

為了獲得最佳結果,建議使用以下採樣設置:

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

社群洞察與技術考量

社群討論強調了開源權重版本與託管式 Qwen3.8-Max 服務之間存在幾個關鍵的權衡。

硬體需求與量化技術

由於其 2.4T 參數數量,完整的 BF16 模型估計大小約為 4.9TB。社群成員指出,在不進行量化的情況下,部署此模型對大多數用戶來說成本極高。

"The 1bit quant model is at an astonishing 397GB... This literally puts Opus 4.5 performance level into a machine a normal person could buy。"

功能差異

用戶指出,開源權重版本缺少了託管式 Qwen3.8-Max 版本中的幾項功能,包括:

  • 視覺支持:開源權重模型是純文本的。
  • 上下文窗口:開源權重版本上限為 250k tokens,而託管版本預設支持 1M tokens。
  • 非思考模式支持:託管版本允許在不需要強制推理階段的情況下進行回應。

許可證

該模型對於內部使用或年收入低於 5000 萬美元的實體是免費的。對於超過此門檻的實體,則適用限制,特別是針對以程式碼編寫或生產力代理為目標的服務。

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch