LFM2.5-2.6B 發佈說明 / 更新內容

Liquid AI 已宣布發佈 LFM2.5-2.6B,這是一款專為在裝置上完全運行強大代理(agents)而設計的模型。透過將小體積與工具調用(tool calling)及多步驟工作流的高性能結合,LFM2.5-2.6B 使開發者能夠在從筆記型電腦到智慧型手機的各種硬體上部署代理,確保數據隱私並消除雲端推論成本。

技術架構與訓練流程

LFM2.5-2.6B 在約 34 兆個 token 上進行了預訓練,並透過中期訓練階段將其上下文窗口擴展至 128K。從基礎模型到專業化代理的轉變是透過四階段的後訓練過程實現的:

  1. 監督式微調 (SFT): 進行兩輪 SFT,重點關注代理數據,包括工具使用、網路搜尋和 harness 軌跡。
  2. 教師專業化 (Teacher Specialization): 為數學、程式碼和工具使用等特定領域創建專業的教師模型。
  3. 多領域在策略蒸餾 (Multi-domain On-Policy Distillation, MOPD): 將這些專業教師模型的知識蒸餾到單個學生模型中。
  4. 代理式強化學習 (Agentic Reinforcement Learning, Agentic RL): 在真實的代理 harness 中進行多輪 RL,以提高模型在各種工具、系統提示詞(system prompts)和任務環境中的操作能力。

Agentic RL 流程利用 Training Engine 進行模型優化,利用 Rollout Engine 進行動作生成,並利用 RL framework 來協調循環。動作會在 Sandbox Service 中執行,並使用 Blackbox Harness(例如 OpenClaw 或 Hermes Agent)和 Harness Proxy 來捕捉 token 級別的軌跡,以進行 RL 訓練驗證。

性能基準測試

LFM2.5-2.6B 可與規模大其四倍的模型競爭,並在指令遵循(instruction following)和工具使用方面經常超越它們。

關鍵基準測試結果

Benchmark LFM2.5-2.6B (2.6B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) Qwen3.5-4B (4.7B) Qwen3.5-9B (9.7B)
AA Omniscience -29.50 -74.47 -49.03 -54.30 -50.43
AIME25 51.87 26.33 34.27 49.33 56.07
IFBench 59.17 34.08 39.24 48.40 56.47
Multi-IF 80.07 69.44 77.35 55.67 62.55
IFStruct 85.49 64.85 76.65 36.25 78.50
BFCLv4 56.88 36.98 46.39 50.56 60.13
ToolSandbox 77.83 52.40 65.00 75.55 76.44
Claw-Eval average (EN) 62.85 53.14 58.02 62.28 66.53
BrowseComp+ (OpenClaw) 26.89 8.31 15.90 24.46 27.23

LFM2.5-2.6B 在列出的每個指令遵循基準測試中都處於領先地位,並且在幾乎所有的工具使用基準測試中也表現出色,僅在 BFCLv4 上被 9.7B 的 Qwen 模型微幅超越。雖然它在代理任務和知識方面仍具備競爭力,但較大的模型在程式碼編寫任務中仍保持明顯領先。

推論速度與硬體相容性

LFM2.5-2.6B 旨在於各種硬體和軟體生態系統中實現高效能推論,包括 llama.cpp, MLX, vLLM, SGLang, 和 ONNX。

  • CPU 推論: 該模型在 Apple M5 Max 上可達到 220 tokens/s 的解碼速度,在 Ryzen AI Max+ 395 上可達到 113 tokens/s,且僅需低於 2.5 GB 的記憶體。
  • GPU 推論: 在高併發情況下,該模型可達到每秒近 15K 個輸出 token,這相當於單個 H100 GPU 每天可處理約 1.3B 個 token。

部署與使用

LFM2.5-2.6B 可在 Hugging Face 上取得,提供 base 和 tuned 版本。它與 transformers>=5.0.0 相容。開發者可以使用 Hugging Face Transformers 函式庫中的 AutoModelForCausalLMAutoTokenizer 類別來實作模型。

Sources