LFM2.5-8B-A1B: 突破端侧智能体 AI 的边界

追求真正的自主本地智能体长期以来一直受到一个根本性权衡的阻碍:处理复杂推理需要海量的参数量,而消费级硬件则面临严格的内存和计算限制。Liquid AI 发布了 LFM2.5-8B-A1B,旨在打破这一僵局。

作为一款面向边缘侧优先的混合专家模型 (MoE),LFM2.5-8B-A1B 专为快速、可靠的工具调用和复杂的指令遵循而设计。通过将稀疏架构与前所未有的预训练规模相结合,Liquid AI 正试图将前沿水平的智能体能力带到入门级笔记本电脑和移动设备上。

架构演进:从 LFM2 到 LFM2.5

LFM2.5-8B-A1B 不仅仅是简单的迭代,而是其前身的大规模扩展。最显著的变化包括:

  • 大规模预训练规模: 该模型在 38 万亿 token 上进行了训练,相比 LFM2-8B-A1B 使用的 12 万亿 token 有了惊人的增长。
  • 扩展的上下文窗口: 上下文窗口从 32,768 增长到了 128,000 token,从而能够处理更长的文档和更长的推理轨迹。
  • 分词器优化: 词汇表扩大了一倍,达到 128,000 token。这是通过在原位扩展现有分词器实现的,显著提高了非拉丁语系脚本的分词效率。例如,泰语和越南语在每个 token 的字符数方面分别提升了 238.2% 和 117.9%。
  • 推理优先方法: 与之前的版本不同,LFM2.5 是一个纯推理模型。它在给出最终答案之前会生成显式的思维链 (CoT)。由于 MoE 模型通常受限于计算量,较低的活跃参数量使得这些推理 token 在计算上非常“廉价”,从而在不牺牲速度的情况下提升了质量。

解决“边缘模型”问题:幻觉与循环

小模型通常受限于有限的知识容量,从而导致频繁的幻觉。Liquid AI 实施了两种特定策略来缓解这一问题:

1. 针对知识边界的定向 RL

为了防止模型编造事实,Liquid AI 在多样化的知识数据集上使用了基于 avg@k 的奖励机制进行了定向强化学习 (RL) 阶段。这鼓励模型在面对超出其可靠知识库的查询时选择弃权,从而在已知和未知信息之间建立起更清晰的边界。

2. 消除“末日循环”

CoT 模型中长推理轨迹有时会陷入重复的“末日循环”。Liquid AI 引入了一个偏好优化阶段,用于识别触发循环行为的 token 并将概率质量重新分配给其他选项。此外,在 RL 期间还添加了塑造奖励 (shaping reward),以抑制使用常见的导致循环的重启词,如 "Wait..."。

性能与基准测试

LFM2.5-8B-A1B 在面对稠密模型和更大的 MoE 模型时都表现出了极具竞争力的性能。

指令遵循与智能体能力

在 IFEval (91.84) 和 Multi-IF (79.93) 等基准测试中,该模型的表现匹配或超过了显著更大的模型,例如 Gemma-4-26B-A4B-IT。这表明该模型能够高度胜任处理复杂的、多步骤的指令——这是有效工具使用的前提条件。

数学与技术任务

在 MATH500 基准测试中,该模型得分 88.76,展示了强大的定量推理能力。然而,社区反馈表明在专业领域仍存在差距。一位用户指出,在一次 bug 修复基准测试中,该模型的表现不如旧版的 Qwen2.5-Coder-3B,这表明虽然通用推理能力很高,但特定领域的编程专家能力可能仍是一个限制因素。

在消费级硬件上无与伦比的吞吐量

LFM2.5-8B-A1B 的核心价值主张之一是其推理速度。该模型提供对 llama.cpp、MLX、vLLM 和 SGLang 的首日支持。

  • CPU 性能: 在 M5 Max 上,模型解码速度为 253 tokens/s,在 Ryzen AI Max+ 395 上达到 146 tokens/s,且内存占用保持在 6 GB 以下。即使在移动电话上,它也能维持约 30 tokens/s。
  • GPU 性能: 在单张 NVIDIA H100 上使用 SGLang,该模型在高并发情况下可以达到 18.5K output tokens per second。

社区观点与批判性分析

虽然技术规格非常出色,但 Hacker News 社区提出了几个讨论点:

  • 过度训练的担忧: 一些用户质疑在 38T token 上训练一个 8B 模型是否高效。一位评论者指出,这远超出了 Chinchilla 缩放定律,即通常建议每个活跃参数对应 20 个 token。
  • “本地优先”的价值主张: 用户们强调,随着本地模型达到“足够好”的阈值(大约前沿模型能力的 80%),放弃云端订阅的经济和隐私激励将变得不可忽视。
  • 身份识别混乱: 一些早期测试者报告,该模型偶尔会将自己识别为 Google 的产品,这可能是由于大规模、多样化的预训练语料库带来的副作用。

结论:通往私有智能体的路径

通过 LocalCowork 演示,Liquid AI 展示了工具分发循环——提问、建议、提议、确认、运行——可以在单台笔记本电脑上实现交互式体验,且无需任何数据离开机器。通过优化吞吐量并利用定向 RL 最小化幻觉,LFM2.5-8B-A1B 代表了迈向未来——一个完全私有、高性能的 AI 智能体直接驻留在我们设备上的未来——的重要一步。

Sources