Inception Labs Mercury 2.5 發布:更快、更便宜的 260K 上下文擴散式語言模型
Mercury 2.5 提升了低延遲、擴散式語言模型的新標準
重點: Inception Labs 的 Mercury 2.5 相較於 Mercury 2,智慧提升 40 %,在一般 NVIDIA GPU 上達到每秒 1,107 個詞元的處理速度,支援最多 260 K 詞元 的上下文,並以每百萬輸入詞元 $0.04 的發行定價——這組合使其成為目前最快、最便宜的生產級擴散式語言模型。
相較於 Mercury 2 的核心改進
- 品質: Inception 聲稱「智慧」提升 40 %,使 Mercury 2.5 與成本優化的前沿模型如 GPT‑5.6 Luna (Low)、Gemini 3.5 Flash‑Lite 及 Claude Haiku 4.5 持平。
- 速度: 基準測試顯示在廣泛可用的 NVIDIA GPU 上達到每秒 1,107 個詞元,社群使用者反覆形容其回應「快得離譜」。
- 上下文視窗: 模型現支援最多 260 K 詞元,可支援極長的互動與廣泛的檢索增強生成(RAG)流程。
- 定價: 標準發行價為每百萬輸入詞元 $0.20、每百萬輸出詞元 $0.75。首發折扣 80 % 使成本降至每百萬輸入詞元 $0.04、每百萬輸出詞元 $0.15。
- 新功能: 可調節的推理能力、平行工具呼叫與符合架構的 JSON 輸出,使模型適用於複雜的代理工作流程。
「Mercury 2.5 是市場上最具能力的擴散式語言模型。據我們所知,這是迄今為止訓練過的最大擴散式語言模型。」 – Inception Labs 博客
實際生產應用場景
搜尋代理與 RAG 流程
- Mercury 2.5 可在單一使用者互動中處理每筆搜尋請求的數十次模型呼叫(查詢重寫、重新排序、事實結構化、摘要與答案驗證)。
- 使用者報告指出,即使需要多個推理步驟,模型的延遲仍能維持端到端搜尋體驗的流暢性。
語音代理
- OpenCall 的 AI 電話代理在生產流量中實現 中位數模型回應延遲約 170 ms。
- 切換至 Mercury 2.5 後,OpenCall 的 P99 延遲從數分鐘降至 1 秒,P50 延遲從 0.4 秒降至 <0.2 秒,表現超越競爭對手。
「使用者聽到的停頓就是延遲;Mercury 2.5 讓這個停頓幾乎可以忽略不計。」 – Oliver Silverstein, OpenCall 首席执行官
程式碼子代理與助理
- Augment Code 使用 Mercury 2.5 進行上下文壓縮與工具搜尋。壓縮延遲下降 82 %(150 秒 → 27 秒),成本降低 90 %,同時保持品質。
- 模型可在不到一秒內從幾個提示生成完整的網頁應用程式,展現其在快速原型設計上的適用性。
Hacker News 社群反饋
| 評論者 | 洞察 / 評論 | 相關性 |
|---|---|---|
| networked | 遭遇 IP 保護的防護機制,返回拒絕訊息,但模型仍能恢復並完成回合。 | 強調內建安全過濾可能干擾底層除錯。 |
| Sphax | 因「廣泛可用 GPU」的宣稱,預期開放權重釋出;但模型仍為閉源。 | 明確開發者對授權的期待。 |
| gertlabs | 測試 Mercury 2.5 預覽版;認為其在通用對話上與舊版開源模型相當,但指出工具使用與代理式程式碼表現較弱。 | 提供與前沿模型相比的平衡現實評估。 |
| irthomasthomas | 指出高詞元吞吐量(1.1 k t/s)可彌補 LLM 聯盟中多模型評估系統的延遲代價。 | 展現對集成架構的戰略優勢。 |
| mrinterweb | 主張速度本身不夠;準確性比原始吞吐量更重要。 | 提醒讀者考慮品質與速度的權衡。 |
| schopra909 | 討論擴散式模型在離散詞元生成上的理論極限,建議未來採用「迴圈式」混合擴散方法。 | 將 Mercury 2.5 置於擴散式語言模型研究的廣泛趨勢中。 |
| piterrro | 使用 Mercury 2.5 作為向量儲存庫結果的二元重新排序器;讚揚其速度與確定性輸出格式。 | 展示低延遲檢索的實用應用案例。 |
| trefoiled | 描述在 OpenRouter 上的體驗為「異常快速」,驗證了基準測試的說法。 | 個人經驗驗證每秒詞元指標。 |
整體情緒:使用者對速度與成本印象深刻,但指出推理準確性與工具使用仍落後於頂級模型。
Mercury Voice 與 Mercury Router 預覽版
- Mercury Voice: 針對語音助理優化的擴散式語言模型,實現 首詞元時間 <170 ms。
- Mercury Router: 一款 dLLM,可分析進來的提示,並根據品質、速度與成本考量,將其路由至最合適的模型(開源或閉源)。
這些預覽版將 Mercury 生態系統延伸至純文字生成之外,專注於即時語音互動與多模型協調。
開始使用
- API 存取: Inception API、Baseten 與 OpenRouter 均提供 Mercury 2.5。
- 免費方案: 提供 100 M 詞元供試用。
- 企業方案: 提供專用容量、自動擴展、合規控制與可設定的資料保留。
- YC 福利: Y Combinator 公司可申領 500 k 美元的部署信用額度。
未來展望
Inception Labs 已開始訓練更大規模的擴散模型,預計於未來數月內釋出,承諾在不犧牲速度或詞元效率的情況下,進一步提升能力。公司也邀請對推進擴散式語言模型感興趣的貢獻者申請參與。
總結
Mercury 2.5 展示了擴散式語言模型可達成 前沿級的詞元吞吐量,同時保持 成本效益 與 低延遲,適用於搜尋、語音與程式碼助理等生產工作負載。發佈後獲得正面評價,尤其在速度與定價方面,但社群反饋指出,推理準確性與工具使用仍需改進,才能與最新專有模型競爭。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch