Qwen2.5-Max 發布說明
Qwen 已宣布發布 Qwen2.5-Max,這是一種透過巨量資料和模型規模來擴展智能的大規模混合專家 (MoE) 模型。該模型現在可透過 Qwen Chat 介面和阿里雲提供的 OpenAI 相容 API 使用。
模型架構與訓練
Qwen2.5-Max 建構於混合專家 (MoE) 架構。其在超過 20 兆個標記的資料集上進行預訓練。為了提升其能力,該模型經過了使用精心策劃的監督微調 (SFT) 和來自人類回饋的強化學習 (RLHF) 方法的後續訓練。
性能基準
Qwen2.5-Max 在數個關鍵基準上,與專有及開放權重模型展現出競爭力的表現:
指令模型性能
與最先進的模型(包括 GPT-4o、Claude-3.5-Sonnet 和 DeepSeek V3)相比,Qwen2.5-Max 指令模型在以下領域表現優於 DeepSeek V3:
- Arena-Hard
- LiveBench
- LiveCodeBench
- GPQA-Diamond
它在 MMLU-Pro 上也展現出競爭力的結果,該基準測試大學水平的知識。
基礎模型性能
在基礎模型的評估中,Qwen2.5-Max 與 Llama-3.1-405B、Qwen2.5-72B 和 DeepSeek V3 進行了比較。Qwen 團隊報告稱,Qwen2.5-Max 基礎模型在這些基準的大多數方面展現出顯著優勢。
可用性與整合
Qwen2.5-Max(模型名稱 qwen-max-2025-01-25)可透過兩個主要管道使用:
- Qwen Chat:使用者可以直接與模型互動,利用工件和搜尋等功能。
- 阿里雲 API:該 API 為 OpenAI 相容,開發者可透過將
base_url指向https://dashscope-intl.aliyuncs.com/compatible-mode/v1,使用標準的 OpenAI Python 函式庫來整合該模型。
未來研究方向
Qwen 正專注於應用縮放強化學習,以進一步提升大型語言模型的思考與推理能力,目標是使模型能超越人類水平的智能。