LFM2.5 Q4_0 发布说明 / 更新内容

Liquid AI 已发布 LFM2.5 模型系列的更新 4-bit 检查点(Q4_0 GGUFs),包括 230M、350M、1.2B-Instruct 和 2.6B 参数版本。这些检查点利用量化感知蒸馏(Quantization-Aware Distillation, QAD)技术,在提供 4-bit 量化带来的内存和速度优势的同时,避免了典型的模型质量下降。

量化感知蒸馏 (QAD) 性能

量化感知蒸馏(QAD)允许将高精度教师模型蒸馏到量化学生模型中。这一过程可以恢复标准量化过程中通常会损失的平均 BF16 准确率的 97%。

在推理、指令遵循、工具使用和智能体能力方面的基准测试结果——包括 GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4——表明 QAD 检查点保留了其 BF16 基准性能的高比例:

  • LFM2.5-230M: 97.1% 保留率
  • LFM2.5-350M: 96.5% 保留率
  • LFM2.5-1.2B-Instruct: 97.4% 保留率
  • LFM2.5-2.6B: 96.6% 保留率

对于数学评估,230M 和 350M 模型在 GSM8K 上进行了测试,而 1.2B-Instruct 和 2.6B 模型在 AIME25 上进行了测试。

边缘硬件吞吐量与效率

与更高精度的量化版本相比,QAD Q4_0 检查点在保持相当质量的同时,提供了显著的吞吐量提升。测试是在 MacBook Pro 和 NucBox EVO-X2(GPU 推理)以及 Samsung Galaxy S26 Ultra 和 Raspberry Pi 5(Arm CPU 推理)上进行的。

关键性能发现包括:

  • LFM2.5-230M 和 350M: 这些模型在质量上与 Q5_K_M 检查点相当,但提供了 4-33% 更高的解码吞吐量。
  • LFM2.5-1.2B 和 2.6B: 这些模型在质量上与 Q4_K_M 检查点相当,并提供了 3-14% 更高的吞吐量。
  • 外部对比: QAD Q4_0 检查点在性能上与 Unsloth 的 UD-Q4_K_XL(针对 230M 和 1.2B 模型)相当,后者是一种高性能的训练后量化检查点。

部署与使用

QAD GGUFs 与 llama.cpp 以及任何支持 GGUF Q4_0 产物的运行时环境兼容。

实现示例

开发者可以使用以下命令运行 LFM2.5-350M 模型:

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

可用模型

以下模型的检查点可在 Hugging Face 上获取:

  • LFM2.5-230M
  • LFM2.5-350M
  • LFM2.5-1.2B-Instruct
  • LFM2.5-2.6B

Sources

相关

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch