microsoft/onnxruntime-genai
Generative AI extensions for onnxruntime
解決的問題
提供一個高效率、彈性十足的 API,可在本地設備上執行生成式 AI 模型(特別是 LLM),無需手動複雜地實作生成循環。
工作原理
本專案實作了 ONNX 模型的完整生成式 AI 循環,包含處理前置處理、透過 ONNX Runtime 執行推論、管理 KV 快取、處理 logits,以及執行搜尋與取樣策略。同時支援用於工具呼叫的語法規範。
適用對象
希望在各種平台(Windows、Linux、Mac、Android)與硬體加速器(CPU、CUDA、DirectML、OpenVINO、QNN、WebGPU)上,使用 ONNX 格式部署生成式 AI 模型的開發者。
主要特色
- 廣泛模型支援:支援 Llama、Phi、Mistral、Gemma 與 Qwen 等多種架構。
- 跨平台相容:可在多個作業系統上運作,並提供 Python、C#、C/C++ 與 Java 的 API。
- 硬體加速:利用 CUDA、DirectML 與 WebGPU 等多種後端以實現最佳化效能。
- 進階生成功能:支援 Multi-LoRA、連續解碼與限制解碼。
相關
- 專案
- 專案
- 專案
- 專案
- 專案