openvinotoolkit/openvino.genai

Run Generative AI models with simple C++/Python API and using OpenVINO Runtime

解决的问题

OpenVINO GenAI 提供了一个轻量级、高性能的库,用于在 PC 和笔记本电脑上本地运行流行的生成式 AI 模型。通过将分词(tokenization)等核心功能直接集成到库中,消除了对外部依赖的需求,降低了本地执行时的资源消耗。

工作原理

该库构建在 OpenVINO Runtime 之上,提供 C++、Python 和 Node.js API 来执行各种生成流水线。它支持在 CPU、GPU 和 NPU 硬件上进行推理。该库包含专门的优化技术,如投机解码(speculative decoding)、KVCache 令牌剔除(KVCache token eviction)和稀疏注意力(sparse attention),以加速生成并减少内存占用。

适用对象

需要无需复杂的依赖链即可在 Intel 硬件上运行 LLM、图像生成器和语音模型的本地 AI 应用程序开发者。

亮点

  • 多模态支持:涵盖文本生成 (LLMs)、视觉处理 (VLMs)、图像生成 (Diffusers)、语音识别 (Whisper)、语音生成 (SpeechT5) 以及文本嵌入和重排序等 RAG 组件。
  • LoRA 适配器支持:允许每个模型加载多个适配器,并使用 Alpha 混合进行混合。
  • 高级优化:实现了投机解码、稀疏注意力 (Tri-shape 和 XAttention) 以及用于推理场景的带前缀缓存的连续批处理。
  • 硬件加速:针对 CPU、GPU 和 NPU 的无缝执行进行了优化。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • Dispatch