LFM2.5-2.6B 發佈說明 / 更新內容
Liquid AI 已宣布發佈 LFM2.5-2.6B,這是一款專為在裝置上完全運行強大代理(agents)而設計的模型。透過將小體積與工具調用(tool calling)及多步驟工作流的高性能結合,LFM2.5-2.6B 使開發者能夠在從筆記型電腦到智慧型手機的各種硬體上部署代理,確保數據隱私並消除雲端推論成本。
技術架構與訓練流程
LFM2.5-2.6B 在約 34 兆個 token 上進行了預訓練,並透過中期訓練階段將其上下文窗口擴展至 128K。從基礎模型到專業化代理的轉變是透過四階段的後訓練過程實現的:
- 監督式微調 (SFT): 進行兩輪 SFT,重點關注代理數據,包括工具使用、網路搜尋和 harness 軌跡。
- 教師專業化 (Teacher Specialization): 為數學、程式碼和工具使用等特定領域創建專業的教師模型。
- 多領域在策略蒸餾 (Multi-domain On-Policy Distillation, MOPD): 將這些專業教師模型的知識蒸餾到單個學生模型中。
- 代理式強化學習 (Agentic Reinforcement Learning, Agentic RL): 在真實的代理 harness 中進行多輪 RL,以提高模型在各種工具、系統提示詞(system prompts)和任務環境中的操作能力。
Agentic RL 流程利用 Training Engine 進行模型優化,利用 Rollout Engine 進行動作生成,並利用 RL framework 來協調循環。動作會在 Sandbox Service 中執行,並使用 Blackbox Harness(例如 OpenClaw 或 Hermes Agent)和 Harness Proxy 來捕捉 token 級別的軌跡,以進行 RL 訓練驗證。
性能基準測試
LFM2.5-2.6B 可與規模大其四倍的模型競爭,並在指令遵循(instruction following)和工具使用方面經常超越它們。
關鍵基準測試結果
| Benchmark | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| Claw-Eval average (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
LFM2.5-2.6B 在列出的每個指令遵循基準測試中都處於領先地位,並且在幾乎所有的工具使用基準測試中也表現出色,僅在 BFCLv4 上被 9.7B 的 Qwen 模型微幅超越。雖然它在代理任務和知識方面仍具備競爭力,但較大的模型在程式碼編寫任務中仍保持明顯領先。
推論速度與硬體相容性
LFM2.5-2.6B 旨在於各種硬體和軟體生態系統中實現高效能推論,包括 llama.cpp, MLX, vLLM, SGLang, 和 ONNX。
- CPU 推論: 該模型在 Apple M5 Max 上可達到 220 tokens/s 的解碼速度,在 Ryzen AI Max+ 395 上可達到 113 tokens/s,且僅需低於 2.5 GB 的記憶體。
- GPU 推論: 在高併發情況下,該模型可達到每秒近 15K 個輸出 token,這相當於單個 H100 GPU 每天可處理約 1.3B 個 token。
部署與使用
LFM2.5-2.6B 可在 Hugging Face 上取得,提供 base 和 tuned 版本。它與 transformers>=5.0.0 相容。開發者可以使用 Hugging Face Transformers 函式庫中的 AutoModelForCausalLM 和 AutoTokenizer 類別來實作模型。