LFM2.5 Q4_0 發佈說明 / 更新內容

Liquid AI 已發佈 LFM2.5 模型系列的更新 4-bit 檢查點 (Q4_0 GGUFs),包括 230M、350M、1.2B-Instruct 和 2.6B 參數版本。這些檢查點利用量化感知蒸餾 (Quantization-Aware Distillation, QAD) 技術,在提供 4-bit 量化帶來的記憶體與速度優勢的同時,避免了典型的模型品質下降。

量化感知蒸餾 (QAD) 效能

量化感知蒸餾 (QAD) 允許將高精度教師模型蒸餾到量化後的學生模型中。此過程可找回標準量化過程中通常會損失的平均 BF16 準確度的 97%。

在推理、指令遵循、工具使用和代理能力方面的基準測試結果——包括 GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4——顯示 QAD 檢查點保留了其 BF16 基準效能的高比例:

  • LFM2.5-230M: 97.1% 保留率
  • LFM2.5-350M: 96.5% 保留率
  • LFM2.5-1.2B-Instruct: 97.4% 保留率
  • LFM2.5-2.6B: 96.6% 保留率

對於數學評估,230M 和 350M 模型在 GSM8K 上進行了測試,而 1.2B-Instruct 和 2.6B 模型則在 AIME25 上進行了測試。

邊緣硬體吞吐量與效率

與高精度量化版本相比,QAD Q4_0 檢查點在保持相當品質的同時,提供了顯著的吞吐量提升。測試是在 MacBook Pro 和 NucBox EVO-X2 (GPU 推理) 以及 Samsung Galaxy S26 Ultra 和 Raspberry Pi 5 (Arm CPU 推理) 上進行的。

關鍵效能發現包括:

  • LFM2.5-230M 與 350M: 這些模型在品質上與 Q5_K_M 檢查點相當,但提供了 4-33% 更高的解碼吞吐量。
  • LFM2.5-1.2B 與 2.6B: 這些模型在品質上與 Q4_K_M 檢查點相當,並提供了 3-14% 更高的吞吐量。
  • 外部比較: QAD Q4_0 檢查點的效能與 Unsloth 的 UD-Q4_K_XL (針對 230M 和 1.2B 模型) 相當,後者是一種高效能的訓練後量化檢查點。

部署與使用

QAD GGUFs 與 llama.cpp 以及任何支援 GGUF Q4_0 產物的版本相容。

實作範例

開發人員可以使用以下指令來執行 LFM2.5-350M 模型:

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

可用模型

檢查點可在 Hugging Face 上取得以下模型的版本:

  • LFM2.5-230M
  • LFM2.5-350M
  • LFM2.5-1.2B-Instruct
  • LFM2.5-2.6B

Sources

相關

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch