LFM2.5 Q4_0 發佈說明 / 更新內容
Liquid AI 已發佈 LFM2.5 模型系列的更新 4-bit 檢查點 (Q4_0 GGUFs),包括 230M、350M、1.2B-Instruct 和 2.6B 參數版本。這些檢查點利用量化感知蒸餾 (Quantization-Aware Distillation, QAD) 技術,在提供 4-bit 量化帶來的記憶體與速度優勢的同時,避免了典型的模型品質下降。
量化感知蒸餾 (QAD) 效能
量化感知蒸餾 (QAD) 允許將高精度教師模型蒸餾到量化後的學生模型中。此過程可找回標準量化過程中通常會損失的平均 BF16 準確度的 97%。
在推理、指令遵循、工具使用和代理能力方面的基準測試結果——包括 GPQA Diamond、MMLU-Pro、IFEval、IFBench、Multi-IF 和 BFCLv4——顯示 QAD 檢查點保留了其 BF16 基準效能的高比例:
- LFM2.5-230M: 97.1% 保留率
- LFM2.5-350M: 96.5% 保留率
- LFM2.5-1.2B-Instruct: 97.4% 保留率
- LFM2.5-2.6B: 96.6% 保留率
對於數學評估,230M 和 350M 模型在 GSM8K 上進行了測試,而 1.2B-Instruct 和 2.6B 模型則在 AIME25 上進行了測試。
邊緣硬體吞吐量與效率
與高精度量化版本相比,QAD Q4_0 檢查點在保持相當品質的同時,提供了顯著的吞吐量提升。測試是在 MacBook Pro 和 NucBox EVO-X2 (GPU 推理) 以及 Samsung Galaxy S26 Ultra 和 Raspberry Pi 5 (Arm CPU 推理) 上進行的。
關鍵效能發現包括:
- LFM2.5-230M 與 350M: 這些模型在品質上與 Q5_K_M 檢查點相當,但提供了 4-33% 更高的解碼吞吐量。
- LFM2.5-1.2B 與 2.6B: 這些模型在品質上與 Q4_K_M 檢查點相當,並提供了 3-14% 更高的吞吐量。
- 外部比較: QAD Q4_0 檢查點的效能與 Unsloth 的 UD-Q4_K_XL (針對 230M 和 1.2B 模型) 相當,後者是一種高效能的訓練後量化檢查點。
部署與使用
QAD GGUFs 與 llama.cpp 以及任何支援 GGUF Q4_0 產物的版本相容。
實作範例
開發人員可以使用以下指令來執行 LFM2.5-350M 模型:
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
可用模型
檢查點可在 Hugging Face 上取得以下模型的版本:
- LFM2.5-230M
- LFM2.5-350M
- LFM2.5-1.2B-Instruct
- LFM2.5-2.6B
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch