Qwen3.8-2.4T-A95B 發佈說明
Qwen3.8-2.4T-A95B 為開源版本帶來了 Qwen-Max 等級的能力
Qwen3.8-2.4T-A95B 是 Qwen 開源模型家族中最強大的世代,在程式碼編寫、專業研究和長程代理任務(long-horizon agentic tasks)方面提供了實質性的提升。該模型建立在 Qwen3.5 的架構基礎之上,旨在以高可靠性和更強的自主規劃能力來處理複雜的多步驟任務。
模型架構與規格
Qwen3.8-2.4T-A95B 是一個因果語言模型(Causal Language Model),利用混合專家架構(Mixture of Experts, MoE)來平衡總參數數量與推理效率。
核心技術規格
- 總參數:2.4 Trillion
- 激活參數:95 Billion
- 層數:92
- 隱藏層維度:8192
- 混合專家架構:總共 512 個專家,每個 token 會激活 10 個路由專家和 1 個共享專家。
- 專家中間層維度:2048
- 上下文長度:原生支持 262,144 tokens,可擴展至 1,010,000 tokens。
- 詞彙表大小:248,320 (padded)。
架構佈局
該模型採用 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE)) 的隱藏佈局。它在 Gated DeltaNet 中具有 128 個用於 V 的線性注意力頭和 16 個用於 QK 的線性注意力頭,並在 Gated Attention 中具有 64 個用於 Q 的注意力頭和 4 個用於 KV 的注意力頭。
性能基準測試
Qwen3.8-Max(基於此模型的官方版本)在面對 Claude Opus 4.8、Fable 5 和 GPT-5.6 Sol 等前沿模型時,展現了極具競爭力的性能。
程式碼編寫與代理性能
Qwen3.8-Max 在 Qwen3.7-Max 之上展現了顯著的改進,特別是在軟體工程基準測試中:
- Terminal Bench 2.1:86.6 (對比 Qwen3.7-Max 的 74.5)
- FrontierSWE:73.5 (對比 Qwen3.7-Max 的 40.7)
- PaperBench:93.0 (領先群體,GPT-5.6 Sol 為 90.5)
- AndroidBench:75.1 (對比 Qwen3.7-Max 的 56.5)
通用能力
- GPQA Diamond:92.6,與 Fable 5 持平,並超越了 Opus 4.8 (92.0)。
- IFBench:82.8,優於 GPT-5.6 Sol (72.7) 和 Fable 5 (63.5)。
- MRCR v2 256K (8-needle):92.9,展現了強大的長上下文檢索能力。
部署與 API 使用
服務框架
Qwen3.8 兼容於多種高吞吐量推理引擎:
- SGLang
- vLLM
- TokenSpeed
API 配置與推理控制
Qwen3.8-2.4T-A95B 是一個純文本模型,所有交互都需要「思考模式」。每個回應都以包含在 <think> 標籤中的推理過程開始。
用戶可以透過 reasoning_effort 參數來控制推理深度:
xhigh(預設):用於需要徹底分析的複雜任務。medium:在準確度與速度之間取得平衡。low:針對速度與成本進行優化。
建議的採樣參數
為了獲得最佳結果,建議使用以下採樣設置:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0。
社群洞察與技術考量
社群討論強調了開源權重版本與託管式 Qwen3.8-Max 服務之間存在幾個關鍵的權衡。
硬體需求與量化技術
由於其 2.4T 參數數量,完整的 BF16 模型估計大小約為 4.9TB。社群成員指出,在不進行量化的情況下,部署此模型對大多數用戶來說成本極高。
"The 1bit quant model is at an astonishing 397GB... This literally puts Opus 4.5 performance level into a machine a normal person could buy。"
功能差異
用戶指出,開源權重版本缺少了託管式 Qwen3.8-Max 版本中的幾項功能,包括:
- 視覺支持:開源權重模型是純文本的。
- 上下文窗口:開源權重版本上限為 250k tokens,而託管版本預設支持 1M tokens。
- 非思考模式支持:託管版本允許在不需要強制推理階段的情況下進行回應。
許可證
該模型對於內部使用或年收入低於 5000 萬美元的實體是免費的。對於超過此門檻的實體,則適用限制,特別是針對以程式碼編寫或生產力代理為目標的服務。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch