google-ai-edge/LiteRT-LM
LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.
解決する課題
LiteRT-LMは、デバイス上で大規模言語モデル(LLM)を実行するために設計された、本番環境対応のオーケストレーション層です。スマートフォン、ノートPC、IoTハードウェアなどのエッジデバイスにおいて、クラウドインフラに依存せずにAIモデルを高性能かつクロスプラットフォームで実行するという課題を解決します。
仕組み
LiteRTのオーケストレーション層として機能し、Gemma、Llama、Phi-4、Qwenなどのモデルを実行するための統一されたAPIを提供します。GPUやNPUを介したハードウェアアクセラレーションを活用してパフォーマンスを最大化し、さまざまなバックエンドをサポートします。また、迅速なテストのためのCLIや、Python、Kotlin、Swift、JavaScript、C++向けの言語固有のAPIも含まれています。
対象ユーザー
Android、iOS、Web、デスクトッププラットフォーム向けにデバイス上でのGenAI体験を構築している開発者、およびRaspberry PiのようなIoTデバイスを対象としている開発者。
ハイライト
- クロスプラットフォーム対応: Android、iOS、Web、デスクトップ、IoTで動作。
- ハードウェアアクセラレーション: GPUおよびNPUアクセラレータを利用してピークパフォーマンスを実現。
- マルチモダリティ: ビジョンおよびオーディオ入力をサポート。
- ツール利用: エージェントワークフローのための関数呼び出し(function calling)をサポート。
- 幅広いモデルサポート: Gemma、Llama、Phi-4、Qwenなどのモデルと互換性。
- マルチトークン予測: 推論速度を向上させるためにMTP drafterをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト