Maple-Preview: 고속 온디바이스 추론을 위한 네이티브 Ternary-Weight MoE
DeepGrove는 오픈 소스 20B-A1B ternary-weight 추론 거대 언어 모델(LLM)인 Maple-Preview를 선보였습니다. 이 모델은 고성능 온디바이스 추론을 위해 특별히 설계되었으며, iPhone에서 초당 127토큰, Mac mini M4에서 초당 218토큰의 속도를 달성하여 Gemma 4 및 Qwen3.5와 같은 다른 효율적인 모델들을 크게 앞섭니다.
추론 효율성을 위한 네이티브 Ternary Weights
Maple-Preview는 전정밀도(full-precision) 모델을 변환한 것이 아니라, 네이티브 ternary-weight 형식으로 학습되었습니다. DeepGrove는 사전 학습된 모델을 낮은 비트너스로 변환하는 것이 성능과 효율성을 불필요하게 제한한다고 주장합니다. 학습 과정에서 저정밀도를 일급 시민(first-class citizen)으로 취급함으로써, 모델은 초저비트너스의 수학적 이점을 활용할 수 있습니다.
초저비트너스 환경에서는 행렬 곱셈을 덧셈으로 효과적으로 대체할 수 있어, 추론에 필요한 총 산술 작업 부하를 낮출 수 있습니다. 이러한 구조적 선택 덕분에 Maple-Preview는 131,072-토큰 컨텍스트 윈도우를 지원하면서도 작은 메모리 점유율(5.31 GB 체크포인트)을 유지할 수 있습니다.
하드웨어 인식 아키텍처
온디바이스 속도를 최적화하기 위해, Maple 아키텍처는 Mac mini 하드웨어에서 직접 테스트된 구성과 함께 하드웨어 인식 설계 루프를 통해 개발되었습니다. 최종 아키텍처는 다음과 같이 구성됩니다:
- Layer 및 Expert 구성: 추론 성능과 추론 효율성 사이의 균형을 맞추기 위해 선택된 24-layer, 256-expert 구성.
- Attention 메커니즘: KV-cache의 증가를 제한하기 위한 sliding-window 및 global attention의 하이브리드 방식.
- 모델 규모: 총 파라미터 20.2B, 활성 파라미터 1.49B.
추론 성능 및 벤치마크
Maple-Preview는 추론 중심 모델로 포지셔닝되어 수학 및 기술 분야에서 강력한 능력을 보여줍니다. MacBook Pro (M5 Pro)에서 IMO 2024 Problem 1을 281.5 tokens/s의 속도로 성공적으로 해결했습니다 (7/7).
벤치마크 평가에서 Maple-Preview (평균 점수: 78.7)와 그 Flash 변형 모델 (평균 점수: 77.7)은 더 큰 모델들과 효과적으로 경쟁합니다. 예를 들어, LCBv6, AIME 26, HMMT 26, GPQA-D를 포함한 일련의 테스트에서 GPT-OSS 20B (평균: 76.3) 및 Qwen3 30B-A3B (평균: 76.6)보다 뛰어난 성능을 보입니다.
"Dreaming"을 통한 온디바이스 적응
DeepGrove는 컨텍스트 기반 메모리를 넘어선 온디바이스 가중치 적응을 실험하고 있습니다. 사용자 선호도를 텍스트 파일이나 긴 컨텍스트에 저장하는 대신, 모델은 가중치를 적응시켜 미묘하고 사용자 특화된 세부 사항을 유지할 수 있습니다.
제공된 데모에서 모델은 사용자의 비건 식단 제한을 식별하고 "dream" 세션을 예약합니다. 이는 모델이 소규모 데이터 세트를 생성하고 스스로를 학습시키는 프로세스입니다. 이 프로세스는 최대 메모리 사용량 5.9 GB로 10~20분이 소요됩니다. 이러한 적응 후 모델은 선호도를 일반화할 수 있는데(예: 실제 가죽 대신 합성 가죽 가방 추천), 이는 메모리가 활성화된 Claude Sonnet 5도 실패했다고 보고된 작업입니다.
커뮤니티 통찰 및 비판
속도 측면에서의 기술적 성취는 널리 찬사를 받고 있지만, Hacker News의 커뮤니티 구성원들은 모델의 신뢰성에 대해 몇 가지 문제를 제기했습니다:
- 환각(Hallucinations): 사용자들은 모델이 특히 과학적 또는 기술적 분야 이외의 틈새 영역에서 "매우 공격적으로 지식을 환각한다"고 보고했습니다.
- 지식 격차: 한 사용자는 특정 단어의 어원에 대해 물었을 때 모델이 "매우 자신 있게 틀린 답을 내놓았다"고 언급하며, 20B 파라미터 크기가 일반 지식 기반을 제한할 수 있음을 시사했습니다.
- 도구 통합: 일부 개발자들은 모델의 속도와 제한된 내부 지식을 고려할 때, 모델의 주요 가치가 고품질 도구 라우팅이나 작은 작업 세트를 위한 빠른 백업 모델로서의 역할에 있다고 제안합니다.
- 구현에 대한 회의론: 일부 사용자들은 "dreaming" 메커니즘에 대해 회의적인 시각을 보이며, 이 정도 크기의 모델이 효과적으로 자기 개선을 할 수 있는지, 아니면 그 프로세스가 특정 사실을 업데이트하는 데 국한되는지에 대해 의문을 제기했습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch