LFM2.5 Q4_0 릴리스 노트 / 새 기능 소개

Liquid AI는 LFM2.5 모델 패밀리의 업데이트된 4비트 체크포인트(Q4_0 GGUF)를 공개했습니다. 이 체크포인트는 230M, 350M, 1.2B-Instruct, 2.6B 파라미터 버전을 포함하며, 일반적인 4비트 양자화로 인한 모델 품질 저하 없이 메모리와 속도 이점을 제공하기 위해 양자화 인식 교육(Quantization-Aware Distillation, QAD) 기술을 활용합니다.

양자화 인식 교육(QAD) 성능

양자화 인식 교육(QAD)은 고정밀도 교사 모델을 양자화된 학습자 모델로 교육하는 기술입니다. 이 과정을 통해 일반적인 양자화에서 흔히 발생하는 BF16 정확도의 97%를 회복할 수 있습니다.

이론적 추론, 지시 따르기, 도구 사용, 에이전트 기능 등 다양한 벤치마크(예: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4)를 통해 QAD 체크포인트가 BF16 베이스라인 성능의 높은 비율을 유지함을 확인했습니다:

  • LFM2.5-230M: 97.1% 유지
  • LFM2.5-350M: 96.5% 유지
  • LFM2.5-1.2B-Instruct: 97.4% 유지
  • LFM2.5-2.6B: 96.6% 유지

수학 평가를 위해 230M 및 350M 모델은 GSM8K에서, 1.2B-Instruct 및 2.6B 모델은 AIME25에서 테스트되었습니다.

엣지 하드웨어의 처리량 및 효율성

QAD Q4_0 체크포인트는 더 높은 정밀도 양자화 버전보다 뛰어난 처리량을 제공하면서도 유사한 품질을 유지합니다. 테스트는 MacBook Pro 및 NucBox EVO-X2(GPU 추론)와 Samsung Galaxy S26 Ultra 및 Raspberry Pi 5(ARM CPU 추론)에서 수행되었습니다.

주요 성능 결과는 다음과 같습니다:

  • LFM2.5-230M 및 350M: Q5_K_M 체크포인트와 동일한 품질을 제공하지만, 디코딩 처리량이 4-33% 더 높습니다.
  • LFM2.5-1.2B 및 2.6B: Q4_K_M 체크포인트와 동일한 품질을 제공하며, 처리량이 3-14% 더 높습니다.
  • 외부 비교: QAD Q4_0 체크포인트는 230M 및 1.2B 모델에서 Unsloth의 UD-Q4_K_XL(고성능 사후 양자화 체크포인트)과 동일한 성능을 보입니다.

배포 및 사용 방법

QAD GGUF는 llama.cpp 및 GGUF Q4_0 아티팩트를 지원하는 모든 런타임과 호환됩니다.

구현 예제

개발자는 다음 명령어를 사용하여 LFM2.5-350M 모델을 실행할 수 있습니다:

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

사용 가능한 모델

다음 모델의 체크포인트는 허깅페이스에서 제공됩니다:

  • LFM2.5-230M
  • LFM2.5-350M
  • LFM2.5-1.2B-Instruct
  • LFM2.5-2.6B

Sources

관련

  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch
  • Dispatch