google-ai-edge/LiteRT

LiteRT, successor to TensorFlow Lite. is Google's On-device framework for high-performance ML & GenAI deployment on edge platforms, via efficient conversion, runtime, and optimization

해결하는 문제

LiteRT는 에지 디바이스에서 머신러닝 및 생성형 AI 모델을 배포하기 위한 고성능 런타임을 제공합니다. 모바일, 웹 및 IoT 플랫폼에서 추론을 실행하는 프로세스를 단순화하는 동시에 사용 가능한 하드웨어 가속(CPU, GPU 및 NPU)의 활용을 극대화합니다.

작동 방식

LiteRT는 PyTorch, TensorFlow, Jax와 같은 프레임워크에서 변환된 최적화된 모델을 실행하는 실행 엔진 역할을 합니다. Compiled Model API를 사용하여 가속기 선택을 자동화하고 비동기 실행을 처리합니다. GenAI의 경우, LLM을 위한 LiteRT-LM 및 WebGPU와 WASM을 통한 브라우저 기반 추론을 위한 LiteRT.js와 같은 전문 도구를 사용합니다.

대상 사용자

Android, iOS, Linux, macOS, Windows 및 Web용 온디바이스 AI 애플리케이션을 구축하는 개발자와 TensorFlow Lite에서 마이그레이션하려는 개발자.

주요 특징

  • 통합 NPU 가속: 다양한 칩셋 제공업체의 NPU에 액세스할 수 있는 단일 API.
  • 교차 플랫폼 지원: Android, iOS, Linux, macOS, Windows, Web 및 IoT(Raspberry Pi)와 호환됨.
  • GenAI 준비 완료: 양자화된 LLM 및 확산 모델을 온디바이스에 배포하기 위한 전용 지원.
  • Compiled Model API: 수동 델리게이트 생성 필요성을 제거하고 I/O 버퍼 처리를 개선하여 개발을 간소화함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트