microsoft/onnxruntime-genai

Generative AI extensions for onnxruntime

解决的问题

提供一个高性能、灵活的 API,用于在本地设备上运行生成式 AI 模型(特别是 LLM),无需手动实现复杂的生成循环。

工作原理

该项目实现了 ONNX 模型的完整生成式 AI 循环,包括处理预处理、通过 ONNX Runtime 执行推理、管理 KV 缓存、处理 logits,以及执行搜索和采样策略。还支持用于工具调用的语法规范。

适用人群

希望在各种平台(Windows、Linux、Mac、Android)和硬件加速器(CPU、CUDA、DirectML、OpenVINO、QNN、WebGPU)上使用 ONNX 格式部署生成式 AI 模型的开发者。

主要亮点

  • 广泛模型支持:支持 Llama、Phi、Mistral、Gemma 和 Qwen 等多种架构。
  • 跨平台兼容:可在多个操作系统上运行,并提供 Python、C#、C/C++ 和 Java 的 API。
  • 硬件加速:利用 CUDA、DirectML 和 WebGPU 等多种后端实现性能优化。
  • 高级生成功能:支持 Multi-LoRA、连续解码和约束解码。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目