LFM2.5-Encoders 출시

LFM2.5-Encoders 출시

Liquid AI는 고효율 장문 컨텍스트 추론을 위해 설계된 두 가지 새로운 범용 인코더 모델인 LFM2.5-Encoder-230MLFM2.5-Encoder-350M을 출시했습니다. 이러한 모델은 훨씬 더 큰 모델과 일반적으로 연관된 품질을 희생하지 않고 표준 CPU 하드웨어에서 문서 규모의 NLP 작업을 수행할 수 있게 합니다.

CPU에서의 고성능 장문 컨텍스트 추론

LFM2.5-Encoders는 CPU 하드웨어에서 긴 시퀀스를 처리할 때 기존 인코더에 비해 상당한 속도 우위를 제공합니다. 8,192 토큰의 컨텍스트 윈도우에서 LFM2.5-Encoder-230M은 ModernBERT-base보다 약 3.7배 빠르며, 약 28초에 순전파를 완료하는 반면 ModernBERT-base는 90초 이상이 소요됩니다.

ModernBERT-base 짧은 입력(Apple GPU에서 1,000 토큰 미만)에서 속도 면에서 앞서갈 수 있지만, 입력 길이가 증가함에 따라 LFM2.5-Encoders가 더 빠른 선택이 되며 약 2,000 토큰부터 선두를 차지합니다.

기술 아키텍처 및 훈련

LFM2.5-Encoders는 LFM2 디코더 백본(LFM2.5-230M 및 LFM2.5-350M)에서 파생되어 세 가지 주요 수정을 통해 양방향 인코더로 변환됩니다.

  1. 양방향 어텐션 마스크: 토큰은 앞뒤 토큰 모두에 참석할 수 있습니다.
  2. 비인과적 짧은 컨볼루션: 대칭 패딩을 사용하여 컨볼루션이 양쪽 이웃을 포함하도록 합니다.
  3. 마스킹된 언어 모델링(MLM): 훈련 중에 토큰의 30%가 마스킹됩니다.

훈련은 두 가지 distinct 단계로 진행되었습니다:

  • 일반 언어 능력: 1,024 토큰 컨텍스트를 사용하는 대형 웹 코퍼스에서의 짧은 컨텍스트 MLM 목표.
  • 장문 컨텍스트 적응: 사실적, 법적, 다언어 능력을 향상시키기 위해 전체 데이터 믹스를 사용하여 컨텍스트를 8,192 토큰으로 확장했습니다.

벤치마크 성능

LFM2.5-Encoders는 GLUE, SuperGLUE 및 다언어 분류의 17개 작업에서 훨씬 더 큰 모델과 효과적으로 경쟁합니다.

  • LFM2.5-Encoder-350M은 14개 테스트된 모델 중 네 번째를 차지하며, 더 큰 모델들(그 중 하나가 거의 10배 크기인 3.5B 파라미터 모델 포함)을 제외하고는 뒤따릅니다.
  • LFM2.5-Encoder-230M은 더 작은 파라미터 수를 유지하면서 ModernBERT-base 및 모든 EuroBERT 모델보다 성능이 뛰어납니다.

실제 응용 및 배포

이 인코더들은 비용 효율적이고 빠른 상태를 유지해야 하는 대용량 이해 작업에 최적화되어 있으며, 예를 들어:

  • Intent Routers: 한 번의 패스로 라우팅 레인에 대한 프롬프트 점수 매기기.
  • Policy Linters: 토큰 수준에서 회사 규칙에 대한 텍스트 검사.
  • PII Detection: 16개 언어에서 개인 식별 정보 식별.
  • Text Classifiers: 긴 문서, 트랜스크립트 또는 지원 스레드의 일반 분류.

모델 선택 가이드

모델 주요 사용 사례
LFM2.5-Encoder-350M 최대 정확도가 우선순위일 때 사용하세요.
LFM2.5-Encoder-230M 더 엄격한 하드웨어 제약 조건이나 더 높은 처리량 요구 사항이 있을 때 사용하세요.

구현 및 사용법

LFM2.5-Encoders는 오픈 가중치이며 transformers 라이브러리를 통해 접근할 수 있습니다. 사용자는 마스킹된 토큰 예측에 사용하거나 분류, 회귀, 검색 작업을 위한 맞춤형 헤드를 붙일 수 있습니다. 지원되는 GPU에서 최대 효율을 위해 Flash Attention 2 사용을 권장합니다.

Sources