Prism ML Bonsai 2 27B, 거의 손실 없는 3진 압축으로 9배 더 작은 풋프린트 달성
Takeaway
Prism ML은 Qwen 3.8 27B의 3진 가중치(-1, 0, +1) 버전인 Ternary Bonsai 2 27B를 출시했습니다. 이 모델은 5.9 GB(가중치당 1.76 유효 비트)의 크기를 차지하며, 전체 정밀도 모델의 종합 벤치마크 점수의 **98.2%**를 유지하여 유사한 성능을 유지하면서도 9배 이상의 크기 감소를 달성했습니다.
모델 개요
- 기반 모델: Qwen 3.8 27B (최첨단 270억 파라미터 멀티모달 모델).
- 압축 방식: FP16 그룹별 스케일링을 적용한 3진 가중치, 가중치당 유효 1.76비트 구현.
- 모델 크기: 디스크 및 메모리상 5.9 GB (전체 정밀도 체크포인트 52 GB의 약 1/9).
- 컨텍스트 윈도우: 262 K 토큰.
- 모달리티: 텍스트 및 이미지 입력.
- 라이선스: Apache 2.0.
- 지원 런타임: NVIDIA GPU용 CUDA, macOS/iOS용 Apple MLX, GGUF 파일을 위한 Prism 커스텀
llama.cpp포크.
벤치마크 성능
다양한 분야(추론, 수학, 코딩, 지시 이행, 비전, 에이전트 도구 사용)에서 Bonsai 2 27B는 83.9점을 기록했으며, 이는 전체 정밀도 Qwen 3.8 27B 종합 점수(85.4)의 **98.2%**에 해당합니다. 상세 작업별 수치는 다음과 같습니다:
| Capability | Bonsai 2 27B | Qwen 3.8 27B | Qwen 3.6 27B |
|---|---|---|---|
| Agentic & Tool-Calling (τ²-bench) | 77.57 | 79.74 | 80.05 |
| Coding (HumanEval+, LiveCodeBench) | 81.58 | 82.17 | 82.57 |
| Instruction Following | 82.66 | 81.25 | 74.53 |
| Knowledge & Reasoning (MMLU-Redux, GPQA) | 83.95 | 86.66 | 84.71 |
| Math (AIME, GSM8K, MATH-500) | 96.57 | 97.06 | 94.64 |
| Vision (CharXiv, A-OKVQA, OmniDocBench) | 78.59 | 81.64 | 79.82 |
| Overall | 83.9 | 85.4 | 83.6 |
그림 I: 벤치마크 점수(사고 모드)는 Bonsai 2 27B가 적은 메모리를 사용하면서도 전체 정밀도 기준 모델을 밀접하게 추종함을 보여줍니다.
가장 중요한 관찰 결과는 코딩, 비전, 장기 에이전트 작업이 대부분의 성능을 유지한다는 점입니다. 이는 일반적으로 공격적인 양자화 하에서 성능이 급격히 저하되는 영역입니다.
지능 밀도
Bonsai 2 27B는 27 B급 모델 중 가장 높은 GB당 지능을 제공합니다. 블로그에 포함된 지능 밀도 차트(그림 II)는 이 모델이 기존의 8비트 또는 4비트 양자화보다 훨씬 우위에 있음을 보여주며, 3진 방식이 트레이드오프 공간에서 독보적임을 확인시켜 줍니다.
처리량 및 에너지 효율성
| Hardware | Tokens / sec (generation) | Energy (mWh/token) |
|---|---|---|
| NVIDIA RTX 5090 | 143 | — |
| NVIDIA RTX 4090 | — | 0.714 |
| Apple M5 Max | 46.8 | — |
RTX 4090에서 Bonsai 2 27B는 전체 정밀도 8 B 모델보다 토큰당 40% 적은 에너지를 소비하므로, 배터리 제약이 있는 기기나 지속적인 백그라운드 어시스턴트에 적합합니다.
실제 영향
- 로컬 지식 작업: 클라우드 왕복 없이 코딩 어시스턴트 루프, 개인 문서 분석, 멀티모달 디버깅 가능.
- 하드웨어 접근성: 16 GB GPU(예: RTX 3060) 및 Prism
llama.cpp포크를 사용하는 Apple 실리콘에서 원활하게 작동. - 경제적 변화: 메모리 및 전력 비용을 절감하여 데이터 센터 랙 및 온디바이스 배포에서 더 높은 모델 밀도 확보 가능.
커뮤니티 피드백 (Hacker News 댓글)
- 설치 팁: 사용자들은 GGUF 모델이 Prism의 커스텀
llama.cpp포크와 작동한다고 보고합니다. 예시 명령줄(macOS, M5 Pro)은 재시작 후 가끔 44 tok/s까지 치솟으며 약 20 tok/s를 보여줍니다. (-ngl 99 -fa on -c 32768) - 성능 편차: 일부 사용자는 Mac Mini M2(16 GB RAM)에서 7-8 tok/s, 6 GB GPU에서 0.67 tok/s를 확인했으며, 원활한 작동을 위해서는 충분한 VRAM(약 8 GB)이 여전히 필요함을 시사합니다.
- 다른 양자화와의 비교: 한 댓글은 동일한 기반 모델의 Q2 양자화(가중치당 약 2.6비트)가 "눈에 띄게 나쁜" 수준의 경계에 있다고 언급하며, Bonsai의 3진 방식이 더 나은 품질-크기 트레이드오프를 제공한다고 평가합니다.
- 브라우저 데모: 커뮤니티에서 구축한 WebGPU 데모가 브라우저 내에서 모델을 완전히 실행하지만, 긴 작업에서는 불안정하다는 보고가 있습니다.
- 추측 디코딩: 추측 디코딩을 사용한 Radeon RX 7900 XTX에서의 벤치마크는 생성 시 약 89 tok/s, 수집 시 약 474 tok/s에 도달하며, 24 K 컨텍스트에서 최대 VRAM은 약 10 GiB입니다.
- 하드웨어 호환성 질문: 사용자들이 AMD/HIP 지원에 대해 문의하고 있습니다. 해결책으로 PTQ2_0 변형을 사용하는 방법이 있는데, 이는 AMD GPU에서 더 빠르지만 약간 더 많은 VRAM을 요구합니다.
- 설명: 5.9 GB 수치는 3진 가중치의 디스크 및 메모리 점유율을 의미하며, 런타임 메모리 사용량은 스케일링 텐서에 대한 오버헤드를 포함하여 거의 동일합니다.
시작하기
- Hugging Face에서 GGUF 모델 다운로드:
prism-ml/Ternary-Bonsai-2-27B-gguf. - Prism의
llama.cpp포크 설치 (릴리스prism-b10685-7dffb15). - 서버 실행:
./llama-prism-b10685-7dffb15/llama-server \ -m Ternary-Bonsai-2-27B-PTQ1_0.gguf \ --port 8331 -ngl 99 -fa on -c 32768 - 내장 웹 UI 또는 OpenAI 호환 API 엔드포인트를 통해 쿼리.
향후 방향
Prism ML의 로드맵은 Qwen 3.8을 기반으로 한 8 B v2 모델을 언급하며, 직접적인 휴대폰 배포를 목표로 하고 있습니다. 또한 3진 압축을 더 큰 MoE 모델(예: Qwen 3.8-Flash-Next)로 확장하고 이 기술을 AMD/HIP 파이프라인에 통합하는 것에 대한 커뮤니티의 관심이 높습니다.
결론
Ternary Bonsai 2 27B는 27 B급 멀티모달 모델에 대해 거의 손실 없는 압축이 이제 실용적임을 입증했습니다. 6 GB 미만의 점유율, 높은 처리량, 가장 까다로운 작업에서의 강력한 성능을 제공합니다. 이번 릴리스는 최첨단 연구 모델과 일상 기기의 하드웨어 제약 사이의 격차를 좁히며, AI가 전체 스택에 걸쳐 배포되는 방식을 재편하고 있습니다.
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch