openvinotoolkit/openvino.genai
Run Generative AI models with simple C++/Python API and using OpenVINO Runtime
解決的問題
OpenVINO GenAI 提供了一個輕量級、高性能的函式庫,用於在 PC 和筆記型電腦上本地執行流行的生成式 AI 模型。透過將分詞(tokenization)等核心功能直接整合到函式庫中,消除了對外部依賴的需求,降低了本地執行時的資源消耗。
工作原理
該函式庫構建在 OpenVINO Runtime 之上,提供 C++、Python 和 Node.js API 來執行各種生成流水線。它支援在 CPU、GPU 和 NPU 硬體上進行推論。該函式庫包含專門的優化技術,例如投機解碼(speculative decoding)、KVCache 權杖剔除(KVCache token eviction)和稀疏注意力(sparse attention),以加速生成並減少記憶體佔用。
適用對象
需要無需複雜的依賴鏈即可在 Intel 硬體上執行 LLM、圖像生成器和語音模型的本地 AI 應用程式開發者。
亮點
- 多模態支援:涵蓋文本生成 (LLMs)、視覺處理 (VLMs)、圖像生成 (Diffusers)、語音辨識 (Whisper)、語音生成 (SpeechT5) 以及文本嵌入和重排序等 RAG 組件。
- LoRA 适配器支援:允許每個模型載入多個适配器,並使用 Alpha 混合進行混合。
- 進階優化:實現了投機解碼、稀疏注意力 (Tri-shape 和 XAttention) 以及用於推理場景的帶前綴快取的連續批處理。
- 硬體加速:針對 CPU、GPU 和 NPU 的無縫執行進行了優化。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch