LFM2.5-2.6B 릴리스 노트 / 새로운 기능
Liquid AI는 온디바이스에서 유능한 에이전트를 구동하기 위해 특별히 설계된 모델인 LFM2.5-2.6B를 출시했다고 발표했습니다. 작은 크기와 도구 사용(tool calling) 및 다단계 워크플로우에서의 높은 성능을 결합함으로써, LFM2.5-2.6B는 개발자가 노트북부터 스마트폰에 이르는 다양한 하드웨어에 에이전트를 배포할 수 있게 하여 데이터 프라이버시를 보장하고 클라우드 추론 비용을 제거합니다.
기술 아키텍처 및 학습 파이프라인
LFM2.5-2.6B는 약 34조 개의 토큰으로 사전 학습되었으며, 미드 트레이닝(mid-training) 단계를 통해 컨텍스트 윈도우를 128K로 확장했습니다. 베이스 모델에서 전문화된 에이전트로 전환하는 과정은 4단계 사후 학습(post-training) 프로세스를 통해 이루어집니다:
- 지도 학습 미세 조정 (SFT): 도구 사용, 웹 검색 및 하네스 궤적(harness trajectories)을 포함하여 에이전트 데이터에 집중한 두 차례의 SFT.
- 교사 전문화 (Teacher Specialization): 수학, 코드, 도구 사용과 같은 특정 도메인에 대한 전문 교사 모델 생성.
- 다중 도메인 온-폴리시 증류 (MOPD): 이러한 전문 교사 모델의 지식을 단일 학생 모델로 증류.
- 에이전트 강화 학습 (Agentic RL): 다양한 도구, 시스템 프롬프트 및 작업 환경에서 작동하는 모델의 능력을 향상시키기 위해 실제 에이전트 하네스 내에서 수행되는 다회차 RL.
Agentic RL 파이프라인은 모델 최적화를 위한 Training Engine, 액션 생성용 Rollout Engine, 그리고 루프를 조율하는 RL framework를 활용합니다. 액션은 Blackbox Harness (예: OpenClaw 또는 Hermes Agent)와 RL 학습 검증을 위한 토큰 수준 궤적을 캡처하는 Harness Proxy를 사용하는 Sandbox Service 내에서 실행됩니다.
성능 벤치마크
LFM2.5-2.6B는 자신의 크기보다 최대 4배 큰 모델들과 경쟁하며, 지시 사항 준수(instruction following) 및 도구 사용에서 종종 그들을 능가합니다.
주요 벤치마크 결과
| 벤치마크 | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| Claw-Eval average (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
LFM2.5-2.6B는 나열된 모든 지시 사항 준수 벤치마크와 거의 모든 도구 사용 벤치마크에서 선두를 달리고 있으며, 9.7B Qwen 모델만이 BFCLv4에서 근소한 차이로 앞서고 있습니다. 에이전트 작업 및 지식 측면에서는 경쟁력이 유지되지만, 코딩 작업에서는 더 큰 모델들이 명확한 우위를 유지하고 있습니다.
추론 속도 및 하드웨어 호환성
LFM2.5-2.6B는 llama.cpp, MLX, vLLM, SGLang, 및 ONNX를 포함한 다양한 하드웨어 및 소프트웨어 생태계에서 고효율 추론을 위해 설계되었습니다.
- CPU 추론: 이 모델은 Apple M5 Max에서 220 tokens/s의 디코딩 속도를 달성하고 Ryzen AI Max+ 395에서 113 tokens/s를 달성하며, 2.5 GB 미만의 메모리를 필요로 합니다.
- GPU 추론: 높은 동시성에서, 이 모델은 초당 거의 15K 출력 토큰에 도달하며, 이는 단일 H100 GPU에서 하루에 약 1.3B 토큰을 처리할 수 있음을 의미합니다.
배포 및 사용법
LFM2.5-2.6B는 Hugging Face에서 base 및 tuned 버전으로 모두 사용 가능합니다. transformers>=5.0.0와 호환됩니다. 개발자는 Hugging Face Transformers 라이브러리의 AutoModelForCausalLM 및 AutoTokenizer 클래스를 사용하여 모델을 구현할 수 있습니다.