Qwen2.5-Turbo 1M Token Context Length Release
Qwen 發布了 Qwen2.5-Turbo,將模型的上下文視窗從 128k 擴展至 100 萬個 token。此更新使處理巨量資料成為可能——相當於約 10 部完整長度的小說或 30,000 行程式碼——同時顯著提升推理速度與成本效益。
擴展的上下文能力
Qwen2.5-Turbo 支援最多 100 萬個 token 的上下文長度,相當於約 100 萬個英文單詞或 150 萬個中文字符。此擴展使得複雜且高 volume 的資料處理任務成為可能,例如摘要整本三部曲小說或執行儲存級別的程式碼分析。
長上下文效能基準
該模型在從超長序列中檢索資訊時展現出高精度:
- Passkey Retrieval: 在 1M 長度的 Passkey Retrieval 任務中達到 100% 準確率。
- RULER 基準: 得分 93.1,優於 GPT-4 (91.6) 和 GLM4-9B-1M (89.9)。
- 複雜理解: 在 LV-Eval 和 LongbenchChat 等基準中,當處理超過 128k token 的上下文時,Qwen2.5-Turbo 在多數維度上超越 GPT-4o-mini。
短序列穩定性
上下文擴展的一個常見問題是較短序列上的效能下降。Qwen2.5-Turbo 的設計旨在保持與 GPT-4o-mini 相當的短序列能力,確保擴大上下文視窗不會影響標準對話或推理效能。
推理優化與成本效益
Qwen2.5-Turbo 透過稀疏注意力機制引入了顯著的優化,以應對長上下文處理的運算需求。
速度與效率
- 降低延遲: 使用稀疏注意力機制將 1M token 上下文的 Time to First Token (TTFT) 從 4.9 分鐘降至 68 秒,相當於 4.3 倍的加速。
- 計算壓縮: 稀疏注意力使注意力計算量減少約 12.5 倍。
價格與價值
- 具成本效益的擴展: 模型定價為每 100 萬 token ¥0.3。在此價格下,Qwen2.5-Turbo 能處理的 token 數量是 GPT-4o-mini 的 3.6 倍。
實作與可用性
Qwen2.5-Turbo 可透過阿里雲 Model Studio API 使用。該 API 與 OpenAI SDK 相容,可使用 qwen-turbo-latest 標識符輕鬆整合到現有的 Python 工作流程中。
開發者可透過以下方式存取模型:
- 阿里雲 Model Studio (API)
- HuggingFace Demo
- ModelScope Demo