LFM2.5-2.6B 发布说明 / 新特性
Liquid AI 宣布发布 LFM2.5-2.6B,这是一款专门为在设备端完全运行高性能智能体而设计的模型。通过将小体积与在工具调用和多步工作流中的高性能相结合,LFM2.5-2.6B 使开发者能够将智能体部署在从笔记本电脑到智能手机的各种硬件上,从而确保数据隐私并消除云端推理成本。
技术架构与训练流水线
LFM2.5-2.6B 在约 34 万亿个 token 上进行了预训练,并通过中期训练阶段将其上下文窗口扩展至 128K。从基础模型到专业化智能体的转变是通过一个四阶段的训练后处理过程实现的:
- 监督微调 (SFT): 两轮 SFT,重点关注智能体数据,包括工具使用、网络搜索和 harness 轨迹。
- 教师专业化 (Teacher Specialization): 为数学、代码和工具使用等特定领域创建专家教师模型。
- 多领域在策略蒸馏 (MOPD): 将这些专家教师的知识蒸馏到单个学生模型中。
- 智能体强化学习 (Agentic RL): 在真实的智能体 harness 中进行多轮 RL,以提高模型在各种工具、系统提示词和任务环境中的操作能力。
Agentic RL 流水线利用 Training Engine 进行模型优化,利用 Rollout Engine 进行动作生成,并利用 RL framework 来编排循环。动作在 Sandbox Service 中执行,使用 Blackbox Harness(例如 OpenClaw 或 Hermes Agent)和 Harness Proxy 来捕获 token 级别的轨迹,以进行 RL 训练验证。
性能基准测试
LFM2.5-2.6B 可与规模大其四倍的模型竞争,并且在指令遵循和工具使用方面通常表现优于它们。
关键基准测试结果
| Benchmark | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| Claw-Eval average (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
LFM2.5-2.6B 在列出的每个指令遵循基准测试和几乎每个工具使用基准测试中都处于领先地位,仅 9.7B 的 Qwen 模型在 BFCLv4 上略微超过了它。虽然它在智能体任务和知识方面保持竞争力,但更大的模型在编程任务中保持着明显的领先地位。
推理速度与硬件兼容性
LFM2.5-2.6B 旨在实现跨各种硬件和软件生态系统的的高效推理,包括 llama.cpp, MLX, vLLM, SGLang, 和 ONNX。
- CPU 推理: 该模型在 Apple M5 Max 上实现了 220 tokens/s 的解码速度,在 Ryzen AI Max+ 395 上实现了 113 tokens/s 的解码速度,且仅需不到 2.5 GB 的内存。 | GPU 推理: 在高并发情况下,该模型每秒可输出近 15K 个 token,这相当于在单个 H100 GPU 上每天产生约 1.3B 个 token。
部署与使用
LFM2.5-2.6B 在 Hugging Face 上提供基础版和微调版。它兼容 transformers>=5.0.0。开发者可以使用 Hugging Face Transformers 库中的 AutoModelForCausalLM 和 AutoTokenizer 类来实现该模型。