LFM2.5-Encoders リリース

LFM2.5-Encoders リリース

Liquid AI は、高効率な長コンテキスト推論のために設計された、新しい汎用エンコーダーモデル 2 つ、LFM2.5-Encoder-230MLFM2.5-Encoder-350M をリリースしました。これらのモデルは、はるかに大きなモデルに関連付けられる品質を犠牲にすることなく、標準の CPU ハードウェアでドキュメント規模の NLP タスクを実行できるようにします。

CPU 上での高パフォーマンス長コンテキスト推論

LFM2.5-エンコーダーは、CPU ハードウェアで長いシーケンスを処理する際に、既存のエンコーダーと比較して大幅な速度優位性を提供します。コンテキストウィンドウが 8,192 トークンの場合、LFM2.5-Encoder-230M は ModernBERT-base と比べて約 3.7 倍高速で、約 28 秒でフォワードパスを完了します。これに対し、ModernBERT-base は 90 秒以上かかります。

While ModernBERT-base may lead in speed for short inputs (below 1,000 tokens on Apple GPU), LFM2.5-Encoders become the faster choice as input length increases, taking the lead from approximately 2,000 tokens onward.

ModernBERT-base は短い入力(Apple GPU で 1,000 トークン未満)では速度で優れているかもしれませんが、入力長が増えるにつれて LFM2.5-エンコーダーがより速い選択肢となり、約 2,000 トークンからリードを取ります。

技術的アーキテクチャとトレーニング

LFM2.5-エンコーダーは、LFM2 デコーダーバックボーン(LFM2.5-230M と LFM2.5-350M)から派生し、3 つの主要な変更により双方向エンコーダーに変換されます。

  1. 双方向アテンションマスク: トークンは前後のトークン両方に注意を向けることができます。
  2. 非因果短畳み込み: 対称パディングを使用することで、畳み込みが両側の近隣を組み込むようになります。
  3. マスクド言語モデリング (MLM): トレーニング中にトークンの 30% がマスクされます。

トレーニングは2つの異なる段階で行われました:

  • 一般的な言語能力: 1,024 トークンのコンテキストを使用した大規模なウェブコーパスでの短コンテキスト MLM 目的。
  • 長コンテキスト適応: 事実、法的、多言語の能力を向上させるために、フルデータミックスを使用してコンテキストを 8,192 トークンに拡張しました。

ベンチマークパフォーマンス

LFM2.5-エンコーダーは、GLUE、SuperGLUE、および多言語分類の 17 のタスクにおいて、はるかに大きなモデルと効果的に競合します。

  • LFM2.5-Encoder-350M は 14 のテスト済みモデルの中で第4位にランクインし、それより大きいモデル(自身のサイズのほぼ 10 倍、3.5B パラメータを含む)にのみ劣っています。
  • LFM2.5-Encoder-230M は、パラメータ数を小さく保ちながら、ModernBERT-base とすべての EuroBERT モデルを上回っています。

実用的なアプリケーションとデプロイ

これらのエンコーダーは、コスト効率が良く高速である必要がある大規模な理解タスクに最適化されており、例えば次のようなタスクがあります:

  • Intent Routers: 1 パスでプロンプトをルーティングレーンに対してスコアリングします。
  • Policy Linters: トークンレベルで会社のルールに対してテストをチェックします。
  • PII Detection: 16 言語にわたって個人情報を特定します。
  • Text Classifiers: 長いドキュメント、トランスクリプト、またはサポートスレッドの一般的な分類。

モデル選択ガイド

モデル 主要なユースケース
LFM2.5-Encoder-350M 最大の精度が優先される場合に使用してください。
LFM2.5-Encoder-230M ハードウェアの制約が厳しい場合や、スループット要件が高い場合に使用してください。

実装と使用方法

LFM2.5-エンコーダーはオープンウェイトであり、transformers ライブラリを介してアクセス可能です。ユーザーはマスクドトークン予測に使用したり、カスタムヘッドを追加して分類、回帰、または検索タスクに使用できます。サポートされている GPU で最大の効率を得るために、Flash Attention 2 の使用が推奨されます。

Sources