microsoft/onnxruntime-genai
Generative AI extensions for onnxruntime
解决的问题
提供一个高性能、灵活的 API,用于在本地设备上运行生成式 AI 模型(特别是 LLM),无需手动实现复杂的生成循环。
工作原理
该项目实现了 ONNX 模型的完整生成式 AI 循环,包括处理预处理、通过 ONNX Runtime 执行推理、管理 KV 缓存、处理 logits,以及执行搜索和采样策略。还支持用于工具调用的语法规范。
适用人群
希望在各种平台(Windows、Linux、Mac、Android)和硬件加速器(CPU、CUDA、DirectML、OpenVINO、QNN、WebGPU)上使用 ONNX 格式部署生成式 AI 模型的开发者。
主要亮点
- 广泛模型支持:支持 Llama、Phi、Mistral、Gemma 和 Qwen 等多种架构。
- 跨平台兼容:可在多个操作系统上运行,并提供 Python、C#、C/C++ 和 Java 的 API。
- 硬件加速:利用 CUDA、DirectML 和 WebGPU 等多种后端实现性能优化。
- 高级生成功能:支持 Multi-LoRA、连续解码和约束解码。
相关
- 项目
- 项目
- 项目
- 项目
- 项目