Picovoice/picollm

On-device LLM Inference Powered by X-Bit Quantization

해결하는 문제

picoLLM은 모바일 기기, 웹 브라우저, 라즈베리 파이와 같은 싱글보드 컴퓨터를 포함한 다양한 하드웨어에서 압축된 대규모 언어 모델(LLM)을 로컬에서 실행할 수 있도록 설계된 크로스플랫폼 추론 엔진입니다. 자원이 제한된 장치에서 높은 정확도의 LLM을 실행하면서도 모든 추론을 100% 로컬에서 처리함으로써 개인정보 보호를 보장합니다.

작동 방식

이 엔진은 독자적인 양자화 알고리즘인 picoLLM Compression을 사용합니다. 일반적인 기법이 고정된 비트 할당을 사용하는 것과 달리, 이 알고리즘은 작업에 특화된 비용 함수를 기반으로 모델의 가중치 전체 및 내부에서 최적의 비트 할당 전략을 자동으로 학습합니다. 이 접근 방식은 GPTQ와 같은 양자화 기법에서 흔히 발생하는 정확도 저하를 크게 줄입니다.

대상 사용자

Android, iOS, 웹(Chrome, Safari, Edge, Firefox), Linux, macOS, Windows, Raspberry Pi 등 다양한 플랫폼에서 로컬 AI 애플리케이션을 개발하는 개발자들입니다. 클라우드 서비스에 의존하지 않고 CPU 또는 GPU에서 오픈웨이트 모델을 배포하고자 하는 분들에게 특별히 적합합니다.

주요 특징

  • 광범위한 하드웨어 지원: 데스크탑, 모바일, 웹 브라우저의 CPU 및 GPU에서 실행 가능.
  • 높은 정확도: 2비트, 3비트, 4비트 설정에서 GPTQ 대비 MMLU 점수 저하를 상당 부분 회복.
  • 100% 로컬 추론: 모든 프롬프트를 로컬에서 처리하여 데이터 프라이버시를 보장.
  • 다양한 모델 지원: Llama-3, Gemma, Mistral, Mixtral, Phi-3.5 및 OCR 및 비전 전용 모델을 포함한 다양한 오픈웨이트 모델과 호환.
  • 다국어 SDK: Python, .NET, Node.js, Android, Java, Swift, C용 공식 SDK 제공.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch