LFM2.5-Encoders 發佈
LFM2.5-Encoders 發佈
Liquid AI 已發佈兩款全新的通用編碼器模型:LFM2.5-Encoder-230M 與 LFM2.5-Encoder-350M,專為高效能長文本推理而設計。這些模型讓文件級別的 NLP 任務能夠在標準 CPU 硬體上執行,且不會犧牲通常與大型模型相關的品質。
CPU 上的高效能長文本推理
在 CPU 硬體上處理長序列時,LFM2.5-Encoders 比現有的編碼器具有顯著的速度優勢。在 8,192 個 token 的上下文窗口下,LFM2.5-Encoder-230M 的速度約為 ModernBERT-base 的 3.7 倍,完成一次前向傳播僅需約 28 秒,而 ModernBERT-base 則需要超過 90 秒。
雖然 ModernBERT-base 在短輸入(Apple GPU 上低於 1,000 個 token)的處理速度上可能佔優,但隨著輸入長度的增加,LFM2.5-Encoders 會成為更快的選擇,並從大約 2,000 個 token 開始取得領先。
技術架構與訓練
LFM2.5-Encoders 源自 LFM2 解碼器骨幹(LFM2.5-230M 和 LFM2.5-350M),透過三項主要修改轉換為雙向編碼器:
- 雙向注意力遮罩 (Bidirectional Attention Mask):Token 可以同時關注前一個和後一個 token。
- 非因果短卷積 (Non-causal Short Convolutions):使用對稱填充,使卷積能夠納入兩側的鄰近內容。
- 遮罩語言模型 (Masked Language Modeling, MLM):在訓練期間遮罩 30% 的 token。
訓練分為兩個不同階段進行:
- 通用語言能力:在大型網路語料庫上使用 1,024 個 token 的上下文進行短上下文 MLM 目標訓練。
- 長文本適應:使用完整的數據混合將上下文擴展至 8,192 個 token,以提升事實、法律和多語言能力。
基準測試性能
LFM2.5-Encoders 在來自 GLUE、SuperGLUE 和多語言分類的 17 項任務中,能與規模大得多的模型進行有效競爭。
- LFM2.5-Encoder-350M 在 14 個測試模型中排名第四,僅次於規模更大的模型,其中包括一個規模接近其 10 倍的模型 (3.5B parameters)。
- LFM2.5-Encoder-230M 在保持較小參數數量的同時,表現優於 ModernBERT-base 和所有 EuroBERT 模型。
實際應用與部署
這些編碼器針對必須保持成本效益且快速的大量理解任務進行了優化,例如:
- 意圖路由器 (Intent Routers):在單次傳播中根據路由通道對提示進行評分。
- 策略檢查器 (Policy Linters):在 token 層級根據公司規則檢查文本。
- PII 檢測:識別 16 種語言中的個人識別資訊。
- 文本分類器:對長文件、逐字稿或支援線程進行通用分類。
模型選擇指南
| 模型 | 主要使用場景 |
|---|---|
| LFM2.5-Encoder-350M | 當最大準確度是首要任務時使用。 |
| LFM2.5-Encoder-230M | 用於硬體限制較嚴或有更高吞吐量需求時。 |
實作與使用
LFM2.5-Encoders 是開源權重,並可透過 transformers 函式庫存取。使用者可以將其用於遮罩 token 預測,或附加自定義標頭用於分類、回歸或檢索任務。為了在受支援的 GPU 上獲得最大效率,建議使用 Flash Attention 2。