microsoft/onnxruntime-genai
Generative AI extensions for onnxruntime
何を解決するか
ONNXモデルの完全な生成ループを実装する高パフォーマンスで柔軟なAPIを提供し、生成ループの複雑な手動実装の必要を排除します。
動作方法
このプロジェクトはONNXモデルの完全な生成AIループを実装しています。前処理の処理、ONNX Runtimeによる推論、KVキャッシュの管理、ロジットの処理、検索およびサンプリング戦略の実行を含みます。また、ツール呼び出し用の文法指定もサポートしています。
対象ユーザー
Windows、Linux、Mac、Androidなどさまざまなプラットフォームとハードウェアアクセラレータ(CPU、CUDA、DirectML、OpenVINO、QNN、WebGPU)で、ONNX形式を使用して生成AIモデルをデプロイしたい開発者。
主な特徴
- 広範なモデル対応: Llama、Phi、Mistral、Gemma、Qwenなど、多数のアーキテクチャをサポート。
- クロスプラットフォーム: 複数のオペレーティングシステムで動作し、Python、C#、C/C++、Java用のAPIを提供。
- ハードウェアアクセラレーション: CUDA、DirectML、WebGPUなどのさまざまなバックエンドを活用してパフォーマンスを最適化。
- 高度な生成機能: Multi-LoRA、連続デコード、制約付きデコードをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト