google-ai-edge/LiteRT-LM

LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.

해결하는 문제

LiteRT-LM은 기기 내에서 대규모 언어 모델(LLM)을 실행하도록 설계된 프로덕션 준비 완료된 오케스트레이션 레이어입니다. 스마트폰, 노트북, IoT 하드웨어와 같은 에지 디바이스에서 클라우드 인프라에 의존하지 않고 AI 모델을 고성능으로 크로스 플랫폼 실행하는 과제를 해결합니다.

작동 방식

LiteRT를 위한 오케스트레이션 레이어 역할을 수행하며 Gemma, Llama, Phi-4, Qwen과 같은 모델을 실행하기 위한 통합 API를 제공합니다. GPU 및 NPU를 통한 하드웨어 가속을 활용하여 성능을 극대화하며 다양한 백엔드를 지원합니다. 또한 빠른 테스트를 위한 CLI와 Python, Kotlin, Swift, JavaScript, C++를 위한 언어별 API를 포함합니다.

대상 사용자

Android, iOS, Web 및 데스크톱 플랫폼을 위한 온디바이스 GenAI 경험을 구축하는 개발자와 Raspberry Pi와 같은 IoT 디바이스를 대상으로 하는 개발자.

주요 특징

  • 크로스 플랫폼 지원: Android, iOS, Web, Desktop 및 IoT에서 작동.
  • 하드웨어 가속: GPU 및 NPU 가속기를 사용하여 성능을 극대화.
  • 멀티 모달리티: 비전 및 오디오 입력 지원.
  • 도구 사용: 에이전트 워크플로우를 위한 함수 호출(function calling) 지원.
  • 폭넓은 모델 지원: Gemma, Llama, Phi-4, Qwen과 같은 모델과 호환.
  • 멀티 토큰 예측: 추론 속도를 높이기 위해 MTP drafter 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트