LFM2.5-DSpark 릴리스 노트 / 새로운 기능
Liquid AI는 LFM2.5 제품군의 세 가지 모델인 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B에 대한 DSpark 초안 모델 체크포인트를 출시했습니다. 이번 업데이트는 디코딩 속도를 크게 향상시키고 함수 호출(function-calling) 지연 시간을 줄이면서도 베이스라인 모델과 동일한 출력 품질을 유지하는 투기적 디코딩(speculative decoding) 경로를 도입합니다.
DSpark의 기술적 아키텍처
DSpark는 일반적으로 DRAM에서 SRAM으로 가중치를 스트리밍하는 비용으로 인해 메모리 대역폭에 제한을 받는 LLM 추론의 디코딩 단계를 최적화합니다. 가벼운 초안 모델을 사용하여 후보 토큰을 제안하면, 타겟 모델이 단일 순방향 패스(forward pass)에서 이를 검증하는 방식을 사용합니다.
DSpark는 이를 달성하기 위해 세 가지 주요 구성 요소를 통합합니다:
- Parallel Backbone: 타겟 모델의 컨텍스트 특징에 따라 조건화된 DFlash 스타일의 백본으로, 단일 순방향 패스에서 모든 초안 토큰의 은닉 상태(hidden states)를 생성합니다.
- Sequential Head: 토큰 간의 의존성을 추가하여 나중 위치의 토큰 수락률을 높이는 가벼운 마르코프 체인(Markov chain) 기반 헤드입니다.
- Confidence-Scheduled Verifier: 각 토큰의 생존 확률을 예측하고, 잠재적인 절감 효과를 초과하는 검증 비용을 방지하기 위해 신뢰도가 낮은 접미사(suffix)를 가지치기(pruning)합니다.
초안 모델 학습 및 사양
Liquid AI는 SFT, chat, code, function-calling 데이터를 포함한 다양한 데이터 믹스를 사용하여 초안 모델을 학습시켰습니다. 모델은 5개의 레이어와 9개의 블록으로 구성된 단순화된 attention-only 아키텍처입니다. 학습은 15 에포크(epoch) 동안 진행되었으며, 최종 체크포인트는 가장 낮은 손실(loss)이 아닌 가장 높은 수락률(acceptance rate)을 기준으로 선택되었습니다.
각 초안 모델은 약 300M 파라미터로 구성됩니다. 구체적인 파라미터 구성은 다음과 같습니다:
| Component | LFM2.5-1.2B-Instruct | LFM2.5-8B-A1B | LFM2.5-2.6B | | :--- | :--- | :--- | :--- | | | Decoder stack (5 layers) | 241.2M | 241.2M | 241.2M | | Hidden-state projection | 21.0M | 21.0M | 21.0M | | Markov head | 33.6M | 65.5M | 65.5M | | Norms + confidence head | 27.5k | 27.5k | 27.5k | | Total | 295.7M | 327.7M | 327.7M |
성능 벤치마크
DSpark는 초안 토큰이 타겟 모델의 분포와 일치할 때만 수락되는 탐욕적 디코딩(greedy decoding)을 사용하므로, 출력은 베이스라인 탐욕적 디코딩과 동일합니다. 따라서 벤치마크 정확도(pass@1 또는 exact match)는 변하지 않습니다.
GPU 및 온디바이스 처리량
테스트는 단일 H100 80 GB (BF16) 환경의 SGLang과 M4 Max MacBook Pro (FP16 GGUF) 환경의 Metal을 사용하는 llama.cpp를 사용하여 수행되었습니다. 모든 설정은 배치 크기 1, 온도(temperature) 0, DSpark 블록 크기 9를 사용했습니다.
LFM2.5-2.6B 성능
| Dataset | Acceptance (of 10) | Speedup on H100 | Speedup on M4 Max | | :--- | :--- | :--- | :--- | | | MATH500 | 5.42 | 3.06x | 2.25x | | HumanEval | 4.54 | 2.56x | 2.63x | | MBPP | 4.71 | 2.64x | 2.11x | | GSM8K | 4.32 | 2.22x | 2.36x | | MT-Bench | 5.07 | 2.87x | 1.99x | | Mean | 4.81 | 2.67x | 2.27x |
LFM2.5-1.2B-Instruct 성능
| Dataset | Acceptance (of 10) | Speedup on H100 | Speedup on M4 Max | | :--- | :--- | :--- | :--- | | | MATH500 | 6.02 | 2.56x | 2.62x | | HumanEval | 5.31 | 2.26x | 2.87x | | MBPP | 5.52 | 2.37x | 2.74x | | GSM8K | 4.34 | 1.67x | 2.73x | | MT-Bench | 3.90 | 1.66x | 1.72x | | Mean | 5.02 | 2.10x | 2.54x |
LFM2.5-8B-A1B 성능
| Dataset | Acceptance (of 10) | Speedup on Speedup on H100 | Speedup on M4 Max | | :--- | :--- | :--- | :--- | | | MATH500 | 8.27 | 3.18x | 1.21x | | HumanEval | 7.02 | 2.58x | 1.12x | | MBPP | 6.93 | 2.64x | 1.09x | | GSM8K | 4.02 | 1.29x | 1.44x | | MT-Bench | 8.52 | 3.02x | 1.04x | | Mean | 6.95 | 2.54x | 1.18x |
LFM2.5-8B-A1B 모델의 경우, llama.cpp의 Metal 백엔드에서의 현재 MoE 구현 제약과 여러 토큰을 검증하기 위해 필요한 가중치 트래픽 증가로 인해 온디바이스 속도 향상은 평균 18%로 제한됩니다.
에이전트 추론 지연 시간
LFM2.5-2.6B 모델의 경우, DSpark는 다양한 멀티 툴 시나리오에서 함수 호출 지연 시간을 평균 57% 감소시킵니다.
구현 및 배포
LFM2.5-DSpark는 출시 첫날부터 다음 프레임워크를 통해 지원됩니다:
- SGLang: LFM2 타겟을 위한 DSpark 지원 빌드가 필요합니다 (PR #31041).
- llama.cpp: 특정 빌드가 필요합니다 (PR #27383).
초안 모델 체크포인트는 Hugging Face에서 1.2B-Instruct, 2.6B, 8B-A1B 변형에 대해 Safetensors 및 GGUF 형식으로 모두 사용 가능합니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch