Inception Labs Mercury 2.5 发布:更快、更便宜的基于扩散的 LLM,支持 260K 上下文
Mercury 2.5 提升了低延迟、基于扩散的语言模型的新标准
要点: Inception Labs 的 Mercury 2.5 相比 Mercury 2 提升了 40 % 的“智能”,在主流 NVIDIA GPU 上实现 1,107 tokens / second 的速度,支持高达 260 K tokens 的上下文窗口,输入 token 的发布定价为 $0.04 / M——这一组合使其成为目前最快、最便宜的生产级扩散 LLM。
相较于 Mercury 2 的核心改进
- 质量: Inception 声称“智能”提升了 40 %,使 Mercury 2.5 与成本优化的前沿模型(如 GPT‑5.6 Luna (Low)、Gemini 3.5 Flash‑Lite 和 Claude Haiku 4.5)处于同一水平。
- 速度: 基准测试显示在广泛可用的 NVIDIA GPU 上达到 1,107 tokens / second,社区用户多次描述其响应“快得离谱”。
- 上下文窗口: 模型现在支持高达 260 K tokens,可实现超长交互和大规模检索增强生成(RAG)流程。
- 定价: 标准发布价为 $0.20 / M 输入和 $0.75 / M 输出。限时优惠 80 % 折扣后,成本降至 $0.04 / M 输入和 $0.15 / M 输出。
- 新功能: 可调节推理、并行工具调用和结构对齐的 JSON 输出,使模型适用于复杂的代理工作流。
“Mercury 2.5 是市场上最强大的扩散 LLM。据我们所知,它是迄今为止训练过的最大的扩散语言模型。” – Inception Labs 博客
真实生产场景应用
搜索代理与 RAG 流水线
- Mercury 2.5 可在单个用户交互中处理数十次模型调用(查询重写、重排序、事实结构化、摘要生成、答案验证)。
- 用户反馈称,即使需要多个推理步骤,该模型的延迟仍能保持端到端搜索体验的流畅性。
语音代理
- OpenCall 的 AI 电话代理在生产流量中实现 中位模型响应延迟 ~170 ms。
- 切换至 Mercury 2.5 后,OpenCall 的 P99 延迟从数分钟降至 1 秒,P50 延迟从 0.4 s 降至 <0.2 s,表现优于竞争对手。
“来电者听到的停顿就是延迟;Mercury 2.5 让这个停顿几乎可以忽略。” – Oliver Silverstein,OpenCall 首席执行官
编码子代理与助手
- Augment Code 使用 Mercury 2.5 进行上下文压缩和工具搜索。压缩延迟降低 82 %(150 s → 27 s),成本下降 90 %,同时保持质量不变。
- 模型可在不到一秒内从少量提示生成完整 Web 应用,展示了其在快速原型设计中的适用性。
Hacker News 社区反馈
| 评论者 | 观点 / 批评 | 相关性 |
|---|---|---|
| networked | 遇到 IP 保护防护机制返回拒绝消息,但模型仍能恢复并完成任务。 | 突显内置安全过滤器可能干扰底层调试。 |
| Sphax | 因“广泛可用 GPU”声明预期开放权重发布;模型仍为闭源。 | 明确开发者对许可的预期。 |
| gertlabs | 测试了 Mercury 2.5 预览版;认为其在通用聊天方面与旧版开源模型相当,但指出工具使用和代理编码性能较弱。 | 提供了与前沿模型相比能力的平衡现实评估。 |
| irthomasthomas | 指出高 token 吞吐量(1.1 k t/s)可缓解 LLM 联盟中多模型评判系统的延迟惩罚。 | 展示了对集成架构的战略优势。 |
| mrinterweb | 认为速度本身不足;准确性比原始吞吐量更重要。 | 提醒读者考虑质量与速度的权衡。 |
| schopra909 | 讨论扩散模型在离散 token 生成中的理论极限,建议未来采用“循环”式混合扩散方法。 | 将 Mercury 2.5 置于扩散模型研究的更广泛趋势中。 |
| piterrro | 将 Mercury 2.5 用作向量存储结果的二元重排序器;称赞其速度和确定性输出格式。 | 展示了低延迟检索的实际应用场景。 |
| trefoiled | 描述在 OpenRouter 上的体验为“奇怪地快”,验证了基准数据。 | 通过轶事验证每秒 token 数指标。 |
总体情绪:用户对速度和成本印象深刻,但指出推理准确性和工具使用仍落后于顶级模型。
Mercury Voice 与 Mercury Router 预览
- Mercury Voice: 针对语音助手优化的基于扩散的 LLM,实现 首 token 延迟 <170 ms。
- Mercury Router: 一种 dLLM,可分类传入提示,并根据质量、速度和成本考量,将请求路由至最合适的模型(开源或闭源)。
这些预览将 Mercury 生态系统扩展至纯文本生成之外,聚焦实时语音交互和多模型编排。
快速上手
- API 访问: Inception API、Baseten 和 OpenRouter 均提供 Mercury 2.5 接口。
- 免费试用: 提供 100 M tokens 用于测试。
- 企业版: 提供专属容量、自动扩展、合规控制和可配置数据保留。
- YC 优惠: Y Combinator 公司可申领 $500 k 部署额度。
展望
Inception Labs 已开始训练更大规模的扩散模型,预计将在未来几个月内发布,承诺在不牺牲速度或 token 效率的前提下进一步提升能力。公司邀请对推进基于扩散的 LLM 感兴趣的贡献者申请加入。
总结
Mercury 2.5 证明了基于扩散的语言模型可以在保持 前沿级 token 吞吐量 的同时,实现 成本效益高 且 低延迟,适用于搜索、语音和编码助手等生产工作负载。发布后获得积极评价,尤其在速度和定价方面,但社区反馈表明,推理准确性和工具使用仍需改进,才能与最新专有模型竞争。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch