Liquid AI의 LFM2.5-8B-A1B: 온-디바이스 MoE의 한계에 도전
소비자 하드웨어에서 고성능 AI를 구현하려는 노력은 오랫동안 성능과 지연 시간 사이의 트레이드오프였습니다. 최첨단 모델은 방대한 지식을 제공하지만, 클라우드에 의존함으로써 프라이버시 문제와 상당한 지연을 초래합니다. Liquid AI는 LFM2.5-8B-A1B를 출시함으로써 이 교착 상태를 깨고자 합니다. 이 모델은 로컬 디바이스에서 빠르고 신뢰할 수 있는 툴 호출 및 에이전시 작업을 위해 특별히 설계된 엣지 최적화 Mixture-of-Experts (MoE) 모델입니다.
프리트레이닝을 38조 토큰으로 확장하고 추론 우선 아키텍처를 구현함으로써, Liquid AI는 엔트리 레벨 노트북에 탑재될 수 있으면서도 훨씬 큰 밀집 모델과 경쟁할 수 있는 모델을 제공하고자 합니다. 이번 출시로 "로컬 우선" AI로의 중요한 전환이 이루어졌으며, 툴 디스패치 루프(질문 → 제안 → 확인 → 명령 실행 과정)가 전적으로 사용자의 기기에서 이루어집니다.
아키텍처 진화: LFM2에서 LFM2.5까지
LFM2.5-8B-A1B는 단순한 반복이 아니라 이전 모델인 LFM2-8B-A1B에 비해 실질적인 업그레이드입니다. 가장 눈에 띄는 변화는 컨텍스트, 토크나이제이션, 그리고 모델이 정보를 처리하는 근본적인 방식에 집중됩니다.
확장된 컨텍스트와 토크나이제이션
엣지 모델의 주요 병목 현상 중 하나는 긴 문서를 처리하는 능력입니다. Liquid AI는 컨텍스트 윈도우를 32,768에서 128,000 토큰으로 확장했습니다. 이는 두 단계 프로세스를 통해 달성되었습니다: 추론 및 툴 사용을 위한 2조 토큰 중간 학습 단계와, 더 긴 윈도우를 수용하기 위해 RoPE 베이스를 늘린 4000억 토큰 단계.
동시에 어휘 수는 65,536에서 128,000으로 두 배가 되었습니다. 이 확장은 비라틴 스크립트를 대상으로 하여 태국어(+238.2%), 베트남어(+117.9%), 힌디어(+120.4%)와 같은 언어에서 효율성이 크게 향상되었습니다.
추론 전용으로의 전환
이전 버전과 달리 LFM2.5-8B-A1B는 추론 전용 모델입니다. 최종 답변을 제공하기 전에 명시적인 사고 사슬(Chain of Thought, CoT)을 생성합니다. Liquid AI는 MoE 모델이 일반적으로 연산에 제한을 받으며, 토큰당 활성화되는 파라미터가 적기 때문에 추론 토큰을 생성하는 것이 계산적으로 "저렴"하고, 인지된 속도에 큰 영향을 주지 않으면서 품질을 향상시킨다고 설명합니다.
"엣지 모델" 문제 해결: 환각과 무한 루프
소형 모델은 지식 용량이 제한되어 환각이나 긴 추론 과정에서 반복적인 "무한 루프"가 발생하기 쉽습니다. Liquid AI는 이를 해결하기 위해 두 가지 구체적인 전략을 구현했습니다:
- Anti-Doom Loop 최적화: 루프 행동을 유발하는 토큰을 식별하는 목표 선호 최적화 단계입니다. 가능성 있는 대안으로 확률 질량을 재분배하고 재시작 단어(예: "Wait...")를 억제하는 RL shaping 보상을 사용함으로써 모델이 반복적인 사이클에 빠질 가능성을 줄입니다.
- 지식 경계 선명화: 환각을 줄이기 위해 Liquid AI는 다양한 지식 데이터셋에 대해 avg@k 기반 보상을 사용했습니다. 이는 모델이 신뢰할 수 있는 지식 베이스 밖의 질문에 답변을 회피하도록 강화하여 불확실성을 보다 명확히 표현하도록 합니다.
성능 및 벤치마크
Liquid AI에 따르면, 이 모델은 이전 버전에 비해 크게 향상되었으며, 특히 AA-Omniscience Index가 +53.62 상승하고 Non-Hallucination Rate가 7.46%에서 63.47%로 급증했습니다.
Qwen3.5-4B 및 Gemma-4 변형과 같은 다른 소형 모델과의 비교 벤치마크에서, LFM2.5-8B-A1B는 명령 수행(IFEval) 및 에이전시 워크플로우(Tau² Telecom)에서 강력한 경쟁력을 보였습니다. 그러나 커뮤니티는 중요한 반론을 제기했습니다. 일부 사용자는 모델이 일반 벤치마크에서는 뛰어나지만 특수 작업에서는 뒤처질 수 있다고 보고했습니다. 예를 들어, 한 사용자는 Qwen2.5-Coder-3B가 버그 수정 벤치마크에서 LFM2.5보다 크게 앞서며, 버그의 약 50%를 해결한 반면 LFM은 약 12%만 해결했다고 언급했습니다.
하드웨어 처리량: "클래스 최고 속도"
Liquid AI는 다양한 하드웨어 전반에 걸친 모델의 효율성을 강조합니다. llama.cpp, MLX, vLLM, SGLang에 대한 첫날 지원을 제공함으로써 Apple, AMD, Intel, Qualcomm, Nvidia 하드웨어에서 모델을 사용할 수 있도록 보장했습니다.
- CPU 성능: M5 Max에서는 초당 253 토큰을 디코딩하고, Ryzen AI Max+ 395에서는 146 토큰/초에 도달하며, 모두 6GB 이하의 RAM을 사용합니다.
- GPU 성능: 단일 NVIDIA H100에서는 높은 동시성에서 초당 18.5K 출력 토큰을 달성할 수 있습니다.
커뮤니티 관점 및 비판적 분석
기술 사양은 인상적이지만, Hacker News 커뮤니티는 몇 가지 주의점을 강조했습니다:
- 과도한 학습 우려: 일부 관찰자는 8B 모델에 38조 토큰을 사용한 것이 전통적인 Chinchilla 스케일링 법칙을 크게 초과하는 비정상적인 데이터 양이라고 지적했습니다. 이는 모델이 벤치마크에 과적합했는지에 대한 의문을 제기합니다.
- 라이선스 미묘함: 블로그 포스트에서는 모델을 "오픈-웨이트"이며 "제한 없음"이라고 설명했지만, 사용자는 라이선스가 연 매출 1천만 달러 이상인 조직에 대해 상당한 제한을 포함하고 있음을 지적했습니다.
- 정체성 혼동: 초기 테스트 사용자 중 일부는 모델이 가끔 자신을 Google 제품으로 식별한다고 보고했으며, 이는 학습 데이터에서 누출이나 아티팩트가 존재할 가능성을 시사합니다.
결론
LFM2.5-8B-A1B는 완전한 프라이버시를 보장하는 온-디바이스 에이전트로 나아가는 대담한 발걸음입니다. 방대한 프리트레이닝 코퍼스와 특화된 추론 아키텍처, 그리고 적극적인 환각 완화 방식을 결합함으로써, Liquid AI는 "충분히 좋은" 로컬 모델이 일상 작업의 대부분에 대해 클라우드 구독 필요성을 대체할 수 있음을 입증하려 합니다. 코더 전용 모델의 특화된 성능에 맞먹을 수 있을지는 아직 미지수이지만, 소비자 하드웨어에서의 처리량과 효율성은 큰 성과라 할 수 있습니다.
SUMMARY: Liquid AI는 38조 토큰으로 학습된 고처리량 Mixture-of-Experts 모델인 LFM2.5-8B-A1B를 소개합니다. 이 모델은 개인용, 온-디바이스 에이전시 워크플로우에 최적화되었습니다.
TITLE: Liquid AI의 LFM2.5-8B-A1B: 온-디바이스 MoE의 한계에 도전