LFM2.5-Encoders 发布

LFM2.5-Encoders 发布

Liquid AI 发布了两个新的通用编码器模型,LFM2.5-Encoder-230MLFM2.5-Encoder-350M,专为高效率长上下文推理而设计。这些模型使得在标准 CPU 硬件上执行文档规模的 NLP 任务成为可能,而不会牺牲通常与更大模型相关联的质量。

CPU 上的高性能长上下文推理

LFM2.5-Encoders 在 CPU 硬件上处理长序列时,相比现有编码器具有显著的速度优势。在 8,192 个标记的上下文窗口下,LFM2.5-Encoder-230M 的速度大约是 ModernBERT-base 的 3.7 倍,完成一次前向传播大约需要 28 秒,而 ModernBERT-base 需要超过 90 秒。

虽然 ModernBERT-base 在短输入(苹果 GPU 上低于 1,000 个标记)时可能在速度上领先,但随着输入长度的增加,LFM2.5-Encoders 成为更快的选择,大约从 2,000 个标记开始领先。

技术架构与训练

LFM2.5-Encoders 源自 LFM2 解码器骨干网络(LFM2.5-230M 和 LFM2.5-350M),通过以下三项主要修改转换为双向编码器:

  1. 双向注意力掩码:标记可以同时关注前序和后序标记。
  2. 非因果短卷积:使用对称填充,使卷积能够纳入两侧的邻居。
  3. 掩码语言建模(MLM):训练期间有 30% 的标记被掩码。

训练分为两个不同的阶段:

  • 通用语言能力:在大型网络语料库上使用 1,024 个标记的上下文进行短上下文 MLM 目标。
  • 长上下文适应:通过完整数据混合将上下文扩展到 8,192 个标记,以提升事实、法律和多语言能力。

基准性能

LFM2.5-Encoders 在 GLUE、SuperGLUE 和多语言分类的 17 项任务中,与显著更大的模型相比表现出色。

  • LFM2.5-Encoder-350M 在 14 个测试模型中排名第四,仅落后于更大的模型,其中包括一个几乎是其 10 倍大小的模型(3.5B 参数)。
  • LFM2.5-Encoder-230M 在保持较小参数量的同时,优于 ModernBERT-base 和所有 EuroBERT 模型。

实际应用与部署

这些编码器针对需要保持成本效益和高速的大规模理解任务进行了优化,例如:

  • 意图路由器:在一次通过中对提示与路由车道进行评分。
  • 策略检查器:在标记级别检查文本是否符合公司规则。
  • PII 检测:在 16 种语言中识别个人身份信息。
  • 文本分类器:对长文档、转录或支持线程进行通用分类。

模型选择指南

Model Primary Use Case
LFM2.5-Encoder-350M 当最大准确度是优先考虑时使用。
LFM2.5-Encoder-230M 用于硬件约束更紧或吞吐量需求更高的情况。

实现与使用

LFM2.5-Encoders 是开放权重的,可通过 transformers 库访问。用户可以使用它们进行掩码标记预测,或附加自定义头用于分类、回归或检索任务。在受支持的 GPU 上,为了达到最高效率,推荐使用 Flash Attention 2。

Sources