xorbitsai/inference

Swap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.

解決する課題

Xinferenceは大規模AIモデルのデプロイとサービングを簡素化します。異なるモデルタイプ向けのインフラストラクチャ設定の複雑さを排除し、ユーザーが1つのコマンドで最先端のオープンソースモデルをデプロイできるようにします。

仕組み

Xinferenceは、テキスト(LLM)、音声認識、マルチモーダルモデルなど、幅広いモダリティをサポートするモデルサービングレイヤーとして機能します。vLLMやggmlなどのエンジンを活用し、異種ハードウェア(GPUとCPU)間でパフォーマンスを最適化します。OpenAI互換のRESTful API、WebUI、Pythonクライアントなど、複数のインタラクションインターフェースを提供し、複数マシンにわたる分散デプロイをサポートします。

対象ユーザー

実験や本番環境でのAIモデルのホスティングとサービングを容易に行いたい研究者、開発者、データサイエンティストのために設計されています。

ハイライト

  • マルチモーダル対応: 言語、音声、画像モデル(テキストから画像へ)および埋め込みモデルをサービングします。
  • 異種ハードウェア: GPUとCPU(ggml経由)の両方をインテリジェントに活用し、Metalなどのプラットフォームをサポートします。
  • 分散サービング: モデル推論を複数のデバイスやマシンに分散して実行できるようにします。
  • OpenAI互換性: 関数呼び出しのサポートを含む、OpenAIと互換性のあるRESTful APIを提供します。
  • 広範な統合: LangChain、LlamaIndex、Dify、RAGFlowなどのフレームワークとシームレスに連携します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト