openvinotoolkit/openvino.genai

Run Generative AI models with simple C++/Python API and using OpenVINO Runtime

解決する課題

OpenVINO GenAIは、PCやノートPC上で一般的な生成AIモデルをローカル実行するための、軽量で高性能なライブラリを提供します。トークン化などのコア機能をライブラリに直接統合することで、外部依存関係の必要性を排除し、ローカル実行時のリソース消費を削減します。

仕組み

OpenVINO Runtimeをベースに構築されたこのライブラリは、さまざまな生成パイプラインを実行するためのC++、Python、Node.js APIを提供します。CPU、GPU、NPUハードウェア上での推論をサポートしています。また、生成を加速させメモリ使用量を削減するために、投機的デコーディング(speculative decoding)、KVCacheトークン追い出し(KVCache token eviction)、スパースアテンション(sparse attention)などの専門的な最適化技術が含まれています。

対象ユーザー

複雑な依存関係なしに、Intelハードウェア上でLLM、画像生成、音声モデルを実行する必要がある、ローカルAIアプリケーションを構築する開発者。

ハイライト

  • マルチモーダル対応: テキスト生成 (LLMs)、視覚処理 (VLMs)、画像生成 (Diffusers)、音声認識 (Whisper)、音声生成 (SpeechT5)、およびテキスト埋め込みやリランキングなどのRAGコンポーネントをカバーしています。
  • LoRAアダプター対応: モデルごとに複数のアダプターをロードし、アルファブレンディングを使用してそれらを混合できます。
  • 高度な最適化: 投機的デコーディング、スパースアテンション (Tri-shape および XAttention)、およびサービングシナリオ向けのプリフィックスキャッシュを備えた連続バッチ処理を実装しています。
  • ハードウェアアクセラレーション: CPU、GPU、NPU間でのシームレスな実行に最適化されています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch