xorbitsai/inference

Swap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.

解決する課題

Xinference は、大規模 AI モデルのデプロイとサービス提供という複雑なプロセスを簡素化します。異なるモデルタイプ向けのインフラ構築の摩擦を取り除き、ユーザーはワンコマンドで実験から本番へ移行できます。

仕組み

Xinference は、テキスト、音声認識、マルチモーダルモデルなど、さまざまなモダリティをサポートするモデルサービングレイヤーとして機能します。vLLM、GGML、TensorRT などのさまざまな推論エンジンを活用し、CPU と GPU などの異種ハードウェアを賢く利用してパフォーマンスを最適化します。OpenAI 互換の統一された RESTful API、WebUI、そしてモデル管理用 CLI を提供します。

対象ユーザー

研究者、開発者、データサイエンティストで、マルチノードクラスタを含むさまざまなハードウェア構成上でオープンソース AI モデルを迅速にデプロイしたい方。

ハイライト

  • マルチモーダルサポート:LLM、画像(テキストから画像生成)、音声、埋め込みモデルを提供。
  • ハードウェアの柔軟性:GGML などのエンジンを通じて CPU、Metal、GPU 加速をサポート。
  • 分散デプロイ:複数のデバイスやマシンでモデルを実行可能。
  • OpenAI 互換性:関数呼び出しをサポートする RESTful API を提供。
  • 幅広い統合:LangChain、LlamaIndex、Dify、RAGFlow とシームレスに連携。