google-ai-edge/LiteRT-LM

LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.

解決する課題

LiteRT-LMは、デバイス上で大規模言語モデル(LLM)を実行するために設計された、本番環境対応のオーケストレーション層です。スマートフォン、ノートPC、IoTハードウェアなどのエッジデバイスにおいて、クラウドインフラに依存せずにAIモデルを高性能かつクロスプラットフォームで実行するという課題を解決します。

仕組み

LiteRTのオーケストレーション層として機能し、Gemma、Llama、Phi-4、Qwenなどのモデルを実行するための統一されたAPIを提供します。GPUやNPUを介したハードウェアアクセラレーションを活用してパフォーマンスを最大化し、さまざまなバックエンドをサポートします。また、迅速なテストのためのCLIや、Python、Kotlin、Swift、JavaScript、C++向けの言語固有のAPIも含まれています。

対象ユーザー

Android、iOS、Web、デスクトッププラットフォーム向けにデバイス上でのGenAI体験を構築している開発者、およびRaspberry PiのようなIoTデバイスを対象としている開発者。

ハイライト

  • クロスプラットフォーム対応: Android、iOS、Web、デスクトップ、IoTで動作。
  • ハードウェアアクセラレーション: GPUおよびNPUアクセラレータを利用してピークパフォーマンスを実現。
  • マルチモダリティ: ビジョンおよびオーディオ入力をサポート。
  • ツール利用: エージェントワークフローのための関数呼び出し(function calling)をサポート。
  • 幅広いモデルサポート: Gemma、Llama、Phi-4、Qwenなどのモデルと互換性。
  • マルチトークン予測: 推論速度を向上させるためにMTP drafterをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト