Qwen2.5-Turbo 1M Token 上下文长度发布

Qwen 发布了 Qwen2.5-Turbo,将模型的上下文窗口从 128k 扩展到 100 万个 token。此更新使得处理海量数据集成为可能——相当于大约 10 部完整长度的小说或 30,000 行代码——同时实现了推理速度和成本效益的显著提升。

扩展的上下文能力

Qwen2.5-Turbo 支持最多 100 万个 token 的上下文长度,这相当于大约 100 万个英文单词或 150 万个汉字。此扩展使得复杂的大规模数据处理任务成为可能,例如总结整本三部曲小说或执行仓库级别的代码分析。

长上下文性能基准

该模型在超长序列中检索信息时表现出高精度:

  • Passkey Retrieval: 在 1M 长度的 Passkey Retrieval 任务中达到 100% 的准确率。
  • RULER 基准: 得分 93.1,优于 GPT-4(91.6)和 GLM4-9B-1M(89.9)。
  • 复杂理解: 在 LV-Eval 和 LongbenchChat 等基准测试中,当处理超过 128k token 的上下文时,Qwen2.5-Turbo 在大多数维度上超越 GPT-4o-mini。

短序列稳定性

上下文扩展常见的问题是在较短序列上性能下降。Qwen2.5-Turbo 的设计旨在保持与 GPT-4o-mini 相当的短序列能力,确保增加上下文窗口不会影响标准的对话或推理性能。

推理优化与成本效益

Qwen2.5-Turbo 通过稀疏注意力机制引入了显著的优化,以应对长上下文处理的计算需求。

速度与效率

  • 降低延迟: 使用稀疏注意力机制将 1M token 上下文的首 token 时间(TTFT)从 4.9 分钟降低到 68 秒,实现了 4.3 倍的加速。
  • 计算压缩: 稀疏注意力将注意力计算量压缩了大约 12.5 倍。

定价与价值

  • 成本效益的扩展: 模型定价为每 100 万 token ¥0.3。在此价格点下,Qwen2.5-Turbo 能处理的 token 数量是 GPT-4o-mini 的 3.6 倍。

实现与可用性

Qwen2.5-Turbo 可通过阿里云 Model Studio API 获得。该 API 与 OpenAI SDK 兼容,使得使用 qwen-turbo-latest 模型标识符在现有 Python 工作流中进行直接集成成为可能。

开发者可以通过以下方式访问该模型:

  • 阿里云 Model Studio (API)
  • HuggingFace 演示
  • **ModelScope 演示"

Sources