QwenLM/Qwen3.8

Qwen3.8 is the large language model series developed by Qwen team, Alibaba Group.

解決的問題

Qwen3.8 是一系列專為處理複雜、多階段任務而設計的開源權重大型語言模型,具備更高的可靠性。它特別針對程式設計、專業研究以及長期導向的智能體任務進行優化,為開源社群帶來「Max級」的效能表現。

工作原理

基於 Qwen3.5 的架構基礎,該系列經過多輪迭代演進:

  • Qwen3.8:聚焦於自主規劃與環境反饋,提升端對端任務完成率。引入 reasoning_effort 以調節推理深度,preserve_thinking 用於在訊息間保留推理上下文。
  • Qwen3.6:注重穩定性與現實世界實用性,特別強化前端工作流程中的智能體程式設計與專案層級推理能力。
  • Qwen3.5:採用統一的視覺-語言基礎架構,透過早期融合訓練,結合混合架構(門控增量網路與稀疏專家混合模型),並在百萬智能體環境中進行強化學習擴展。

適用對象

尋求高性能量子模型用於軟體開發、自主智能體及多模態應用的開發者與企業,支援 201 種語言與方言。

核心亮點

  • 智能體能力:更強的自主規劃能力,更優的環境反饋處理,確保任務可靠完成。
  • 統一的多模態基礎:在數兆 token 上進行早期融合訓練,實現推理、程式設計與視覺理解能力的均衡對齊。
  • 靈活的思維控制:可調節推理深度,並在對話中保留思考上下文。
  • 廣泛相容性:支援 vLLM、SGLang、TokenSpeed 等主流推理引擎,以及 Unsloth、Llama-Factory 等訓練框架。

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch