Qwen2.5-Turbo 1M Token Context Length Release

Qwen 發布了 Qwen2.5-Turbo,將模型的上下文視窗從 128k 擴展至 100 萬個 token。此更新使處理巨量資料成為可能——相當於約 10 部完整長度的小說或 30,000 行程式碼——同時顯著提升推理速度與成本效益。

擴展的上下文能力

Qwen2.5-Turbo 支援最多 100 萬個 token 的上下文長度,相當於約 100 萬個英文單詞或 150 萬個中文字符。此擴展使得複雜且高 volume 的資料處理任務成為可能,例如摘要整本三部曲小說或執行儲存級別的程式碼分析。

長上下文效能基準

該模型在從超長序列中檢索資訊時展現出高精度:

  • Passkey Retrieval: 在 1M 長度的 Passkey Retrieval 任務中達到 100% 準確率。
  • RULER 基準: 得分 93.1,優於 GPT-4 (91.6) 和 GLM4-9B-1M (89.9)。
  • 複雜理解: 在 LV-Eval 和 LongbenchChat 等基準中,當處理超過 128k token 的上下文時,Qwen2.5-Turbo 在多數維度上超越 GPT-4o-mini。

短序列穩定性

上下文擴展的一個常見問題是較短序列上的效能下降。Qwen2.5-Turbo 的設計旨在保持與 GPT-4o-mini 相當的短序列能力,確保擴大上下文視窗不會影響標準對話或推理效能。

推理優化與成本效益

Qwen2.5-Turbo 透過稀疏注意力機制引入了顯著的優化,以應對長上下文處理的運算需求。

速度與效率

  • 降低延遲: 使用稀疏注意力機制將 1M token 上下文的 Time to First Token (TTFT) 從 4.9 分鐘降至 68 秒,相當於 4.3 倍的加速。
  • 計算壓縮: 稀疏注意力使注意力計算量減少約 12.5 倍。

價格與價值

  • 具成本效益的擴展: 模型定價為每 100 萬 token ¥0.3。在此價格下,Qwen2.5-Turbo 能處理的 token 數量是 GPT-4o-mini 的 3.6 倍。

實作與可用性

Qwen2.5-Turbo 可透過阿里雲 Model Studio API 使用。該 API 與 OpenAI SDK 相容,可使用 qwen-turbo-latest 標識符輕鬆整合到現有的 Python 工作流程中。

開發者可透過以下方式存取模型:

  • 阿里雲 Model Studio (API)
  • HuggingFace Demo
  • ModelScope Demo

Sources