openvinotoolkit/openvino.genai

Run Generative AI models with simple C++/Python API and using OpenVINO Runtime

解決的問題

OpenVINO GenAI 提供了一個輕量級、高性能的函式庫,用於在 PC 和筆記型電腦上本地執行流行的生成式 AI 模型。透過將分詞(tokenization)等核心功能直接整合到函式庫中,消除了對外部依賴的需求,降低了本地執行時的資源消耗。

工作原理

該函式庫構建在 OpenVINO Runtime 之上,提供 C++、Python 和 Node.js API 來執行各種生成流水線。它支援在 CPU、GPU 和 NPU 硬體上進行推論。該函式庫包含專門的優化技術,例如投機解碼(speculative decoding)、KVCache 權杖剔除(KVCache token eviction)和稀疏注意力(sparse attention),以加速生成並減少記憶體佔用。

適用對象

需要無需複雜的依賴鏈即可在 Intel 硬體上執行 LLM、圖像生成器和語音模型的本地 AI 應用程式開發者。

亮點

  • 多模態支援:涵蓋文本生成 (LLMs)、視覺處理 (VLMs)、圖像生成 (Diffusers)、語音辨識 (Whisper)、語音生成 (SpeechT5) 以及文本嵌入和重排序等 RAG 組件。
  • LoRA 适配器支援:允許每個模型載入多個适配器,並使用 Alpha 混合進行混合。
  • 進階優化:實現了投機解碼、稀疏注意力 (Tri-shape 和 XAttention) 以及用於推理場景的帶前綴快取的連續批處理。
  • 硬體加速:針對 CPU、GPU 和 NPU 的無縫執行進行了優化。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • Dispatch