Picovoice/picollm

On-device LLM Inference Powered by X-Bit Quantization

What it solves

고정밀 크로스 플랫폼 SDK를 제공하여 압축된 대형 언어 모델(LLM)을 로컬에서 실행합니다. 이를 통해 클라우드 기반 추론이 필요 없으며 데이터 프라이버시를 보장하고 모바일 디바이스부터 싱글 보드 컴퓨터까지 다양한 하드웨어에서 AI를 구동할 수 있습니다.

How it works

엔진은 picoLLM Compression이라는 독점 양자화 알고리즘을 사용합니다. 표준 고정 비트 할당 방식과 달리, 이 알고리즘은 작업별 비용 함수를 기반으로 가중치에 대한 최적 비트 할당 전략을 자동으로 학습하여 GPTQ와 같은 방법에 비해 정확도 손실을 크게 줄입니다.

Who it’s for

Android, iOS, Web(Chrome, Safari, Edge, Firefox), Linux, macOS, Windows, Raspberry Pi용 로컬 AI 애플리케이션을 개발하는 개발자를 위한 것입니다.

Highlights

  • Local Inference: CPU와 GPU에서 100% 로컬 실행으로 최대 프라이버시 보장.
  • Broad Model Support: Llama-3, Gemma, Mistral, Mixtral, Phi-3.5, Qwen3-VL 등 오픈 웨이트 모델과 호환.
  • High Accuracy: 표준 GPTQ 양자화에서 나타나는 MMLU 점수 감소를 크게 회복.
  • Multi-Platform SDKs: Python, .NET, Node.js, Android, iOS, Web, C에 대한 네이티브 지원.