trymirai/uzu
A high-performance inference engine for AI models
解決する課題
uzu は高性能な推論エンジンで、開発者が AI モデルを直接アプリケーション内にデプロイできるよう設計されています。外部 API 呼び出しが不要になるため、推論コストが削減され、データプライバシーが完全に保護され、ローカルでモデルを実行することでレイテンシゼロの応答が得られます。
仕組み
uzu は Rust、Python、TypeScript、Swift の複数言語に対応したハイレベル API を提供し、モデルのライフサイクル全体を管理します。モデルの検出、自動ダウンロード、推論設定を自動で行います。Apple デバイス上では、統合メモリを活用してパフォーマンスを最適化します。また、ハイブリッド方式もサポートしており、統一インターフェースを通じてローカルのオンデバイスモデルとクラウドベースのモデル(例:OpenAI)を切り替えることができます。
対象者
このエンジンは、iOS、macOS、クロスプラットフォームアプリ向けに、ソフトウェアに LLM を統合したいアプリケーション開発者向けに作られています。クラウドインフラに依存せず、トークンごとのコストを負担することなく利用できます。
ハイライト
- マルチ言語サポート:Rust、Python、TypeScript、Swift のネイティブバインディングを提供。
- オンデバイス最適化:Apple ハードウェアのユニファイドメモリを活用して効率化。
- プライバシーとコスト:ローカル実行によりデータがデバイスから出ることはなく、API 手数料も不要。
- 構造化出力:Grammar と JSON スキーマの使用をサポートし、モデルが有効で構造化されたデータを返すよう強制。
- ハイブリッド柔軟性:ローカルオンデバイス推論とクラウドモデル統合の両方を統一 API で提供。