LFM2.5-8B-A1B: 挑戰裝置端代理型 AI 的極限

追求真正的自主本地代理一直受到一個根本性的權衡所阻礙:處理複雜推理所需的海量參數數量,與消費級硬體嚴格的記憶體和運算限制之間的矛盾。Liquid AI 發布的 LFM2.5-8B-A1B 旨在打破這一僵局。

作為一款以邊緣端為先的混合專家模型 (MoE),LFM2.5-8B-A1B 專為快速、可靠的工具調用和複雜指令遵循而設計。透過將稀疏架構與前所未有的預訓練規模相結合,Liquid AI 正嘗試將前沿級的代理能力帶入入門級筆記型電腦和行動裝置。

架構演進:從 LFM2 到 LFM2.5

LFM2.5-8B-A1B 不僅僅是簡單的迭代,而是其前身的大幅擴展。最顯著的變化包括:

  • 海量預訓練規模: 該模型在 38 兆個 token 使用進行訓練,相較於 LFM2-8B-A1B 使用的 12 兆個 token 有了驚人的增長。
  • 擴展的上下文窗口: 上下文窗口已從 32,768 增長到 128,000 個 token,能夠處理更長的文檔和更長的推理軌跡。
  • Tokenizer 優化: 詞彙表規模增加了一倍,達到 128,000 個 token。這是透過在原位擴展現有的 tokenizer 所實現的,這顯著提高了非拉丁文字的 tokenization 效率。例如,泰語和越南語在每個 token 的字元數方面分別提升了 238.2% 和 117.9%。
  • 推理優先方法: 與之前的版本不同,LFM2.5 是一個僅限推理的模型。它在提供最終答案之前會產生顯式的思維鏈 (CoT)。由於 MoE 模型通常受限於運算量,較少的活躍參數使得這些推理 token 在運算上非常「廉價」,在不犧牲速度的情況下提供了品質提升。

解決「邊緣模型」問題:幻覺與循環

小型模型通常受限於有限的知識容量,導致頻繁的幻覺。Liquid AI 實施了兩種特定策略來減輕這一點:

1. 針對知識邊界的定向 RL

為了防止模型編造事實,Liquid AI 利用了基於 avg@k 的獎勵機制,在多樣化的知識數據集上進行了定向強化學習 (RL) 階段。這鼓勵模型在面對超出其可靠知識庫的查詢時選擇放棄回答,從而在已知與未知資訊之間建立更清晰的界限。

2. 消除「末日循環」

CoT 模型中長篇的推理軌跡有時會陷入重複的「末日循環」。Liquid AI 引入了偏好優化階段,以識別觸發循環行為的 token,並將機率質量重新分配到其他選項上。此外,在 RL 期間加入了塑造獎勵 (shaping reward),以阻止使用常見的循環誘發啟動詞,例如「Wait...」。

性能與基準測試

LFM2.5-8B-A1B 在面對密集模型和較大的 MoE 模型時,展現了具競爭力的性能。

指令遵循與代理能力

在 IFEval (91.84) 和 Multi-IF (79.93) 等基準測試中,該模型表現出與顯著較大的模型(如 Gemma-4-26B-A4B-IT)相當甚至超越其性能的表現。這表明該模型高度具備遵循複雜、多步驟指令的能力——這是有效工具使用的先決條件。

數學與技術任務

在 MATH500 基準測試中,該模型得分 88.76,展現了強大的定量推理能力。然而,社群回饋指出在專業領域存在差距。一位用戶指出,在一個除錯 (bug-fixing) 基準測試中,該模型的表現被較舊的 Qwen2.5-Coder-3B 超越,這表明雖然通用推理能力很高,但特定領域的編碼專家知識可能仍是一個限制因素。

消費級硬體上無與倫比的吞吐量

LFM2.5-8B-A1B 的主要價值主張之一是其推理速度。該模型提供對 llama.cpp、MLX、vLLM 和 SGLang 的首日支援。

  • CPU 性能: 在 M5 Max 上,模型解碼速度為 253 tokens/s,在 Ryzen AI Max+ 395 上達到 146 tokens/s,且記憶體使用量保持在 6 GB 以下。即使在行動電話上,它也能維持大約 30 tokens/s。
  • GPU 性能: 在單個 NVIDIA H100 上使用 SGLang,該模型在高併發情況下可以達到 18.5K output tokens per second。

社群觀點與批判性分析

雖然技術規格非常出色,但 Hacker News 社群提出了幾點討論:

  • 過度訓練的疑慮: 一些用戶質疑在 38T token 上訓練一個 8B 模型是否有效率。一位評論者指出,這遠超出了 Chinchilla scaling laws,通常建議為每個活躍參數配備 20 個 token。
  • 「本地優先」的價值主張: 用戶強調,隨著本地模型達到「足夠好」的門檻(大約是前沿級能力的 80%),放棄雲端訂閱的經濟與隱私隱憂會變得非常強大。
  • 身份識別混淆: 一些早期測試者回報,該模型偶爾會將自己識別為 Google 的產品,這可能是由於大規模、多樣化的預訓練語料庫所導致的副作用。

結論:通往私密代理的道路

透過 LocalCowork 演示,Liquid AI 展現了工具調用循環——詢問、提議、確認、執行——可以在單台筆記型電腦上進行互動式操作,且無需任何數據離開機器。透過優化吞吐量並藉由定向 RL 最小化幻覺,LFM2.5-8B-A1B 代表了邁向未來的一個重要步驟,即完全私密、高性能的 AI 代理將直接駐留在我們的裝置端。

Sources