LFM2.5-DSpark 发布说明 / 更新内容
Liquid AI 发布了 LFM2.5 系列中三个模型的 DSpark 草稿模型检查点:LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B。此次更新引入了一种投机解码路径,在保持与基准模型相同的输出质量的同时,显著提高了解码速度并降低了函数调用(function-calling)的延迟。
DSpark 的技术架构
DSpark 优化了 LLM 推理的解码阶段,由于从 DRAM 流式传输权重到 SRAM 的成本,该阶段通常受限于内存带宽。它利用轻量级草稿模型来提出候选 token,然后由目标模型在单次前向传播中进行验证。
DSpark 集成了三个主要组件来实现这一点:
- Parallel Backbone:一种基于 DFlash 风格的骨干网络,以目标模型的上下文特征为条件,在单次前向传播中为所有草稿 token 生成隐藏状态。
- Sequential Head:一种基于轻量级马尔可夫链的头部,通过增加 token 间的依赖关系来提高后续位置 token 的接受率。
- Confidence-Scheduled Verifier:一种机制,用于预测每个 token 的生存概率并修剪低置信度的后缀,以避免验证成本超过潜在收益。
草稿模型训练与规格
Liquid AI 使用包括 SFT、chat、code 和 function-calling 数据在内的多样化数据混合进行训练草稿模型。这些模型采用了简化的仅注意力(attention-only)架构,由 5 层和 1 个包含 9 个元素的块组成。训练持续了 15 个 epoch,最终的检查点是根据最高的接受率而非最低的损失值(loss)来选择的。
每个草稿模型大约有 300M 参数。具体的参数分解如下:
| Component | LFM2.5-1.2B-Instruct | LFM2.5-8B-A1B | LFM2.5-2.6B | | :--- | :--- | :--- | :--- | :--- | | Decoder stack (5 layers) | 241.2M | 241.2M | 241.2M | | Hidden-state projection | 21.0M | 21.0M | 21.0M | | Markov head | 33.6M | 65.5M | 65.5M | | Norms + confidence head | 27.5k | 27.5k | 27.5k | | Total | 295.7M | 327.7M | 327.7M |
性能基准测试
由于 DSpark 使用贪婪解码(greedy decoding),即只有当草稿 token 与目标模型的分布匹配时才会被接受,因此输出与基准贪婪解码完全一致。因此,基准准确率(pass@1 或精确匹配)保持不变。
GPU 和端侧吞吐量
测试是在单台 H100 80 GB (BF16) 上使用 SGLang,以及在 M4 Max MacBook Pro (FP16 GGUF) 上使用带有 Metal 的 llama.cpp 进行的。所有配置均使用 batch size 为 1,temperature 为 0,以及 DSpark block size 为 9。
LFM2.5-2.6B 性能表现
| Dataset | Acceptance (of 10) | Speedup on H100 | Speedup on M4 Max | | :--- | :--- | :--- | :--- | :--- | | MATH500 | 5.42 | 3.06x | 2.25x | | HumanEval | 4.54 | 2.56x | 2.63x | | MBPP | 4.71 | 2.64x | 2.11x | | GSM8K | 4.32 | 2.22x | 2.36x | | MT-Bench | 5.07 | 2.87x | 1.99x | | Mean | 4.81 | 2.67x | 2.27x |
LFM2.5-1.2B-Instruct 性能表现
| Dataset | Acceptance (of 10) | Speedup on H100 | Speedup on M4 Max | | :--- | :--- | :--- | :--- | :--- | | MATH500 | 6.02 | 2.56x | 2.62x | | HumanEval | 5.31 | 2.26x | 2.87x | | MBPP | 5.52 | 2.37x | 2.74x | | GSM8K | 4.34 | 1.67x | 2.73x | | MT-Bench | 3.90 | 1.66x | 1.72x | | Mean | 5.02 | 2.10x | 2.54x |
LFM2.5-8B-A1B 性能表现
| Dataset | Acceptance (of 10) | Speedup | Speedup on M4 Max | | :--- | :--- | :--- | :--- | :--- | | MATH500 | 8.27 | 3.18x | 1.21x | | HumanEval | 7.22 | 2.58x | 1.12x | | MBPP | 6.93 | 2.64x | 1.09x | | GSM8K | 4.02 | 1.29x | 1.44x | | MT-Bench | 8.52 | 3.02x | 1.04x | | Mean | 6.95 | 2.54x | 1.18x |
对于 LFM2.5-8B-A1B 模型,由于目前 llama.cpp 的 Metal 后端在 MoE 实现上的限制以及验证多个 token 所需增加的权重传输量,端侧加速比受限于平均 18% 的加速。
智能体推理延迟
对于 LFM2.5-2.6B 模型,DSpark 在各种多工具场景下将函数调用(function-calling)延迟平均降低了 57%。
实现与部署
LFM2.5-DSpark 在发布首日即通过以下框架支持:
- SGLang:需要针对 LFM2 目标的构建版本(PR #31041)。
- llama.cpp:需要特定构建版本(PR #27383)。
草稿模型检查点已在 Hugging Face 上提供,包含 1.2B-Instruct、2.6B 和 8B-A1B 变体,格式均为 Safetensors 和 GGUF。
Sources
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch