microsoft/onnxruntime-genai

Generative AI extensions for onnxruntime

何を解決するか

ONNXモデルの完全な生成ループを実装する高パフォーマンスで柔軟なAPIを提供し、生成ループの複雑な手動実装の必要を排除します。

動作方法

このプロジェクトはONNXモデルの完全な生成AIループを実装しています。前処理の処理、ONNX Runtimeによる推論、KVキャッシュの管理、ロジットの処理、検索およびサンプリング戦略の実行を含みます。また、ツール呼び出し用の文法指定もサポートしています。

対象ユーザー

Windows、Linux、Mac、Androidなどさまざまなプラットフォームとハードウェアアクセラレータ(CPU、CUDA、DirectML、OpenVINO、QNN、WebGPU)で、ONNX形式を使用して生成AIモデルをデプロイしたい開発者。

主な特徴

  • 広範なモデル対応: Llama、Phi、Mistral、Gemma、Qwenなど、多数のアーキテクチャをサポート。
  • クロスプラットフォーム: 複数のオペレーティングシステムで動作し、Python、C#、C/C++、Java用のAPIを提供。
  • ハードウェアアクセラレーション: CUDA、DirectML、WebGPUなどのさまざまなバックエンドを活用してパフォーマンスを最適化。
  • 高度な生成機能: Multi-LoRA、連続デコード、制約付きデコードをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト