bentoml/OpenLLM

Run any open-source LLMs, such as DeepSeek and Llama, as OpenAI compatible API endpoint in the cloud.

What it solves

OpenLLMは、オープンソースの大規模言語モデル (LLM) のセルフホストプロセスを簡素化します。推論サーバーのセットアップの複雑さを解消し、開発者が Llama 3.3、Qwen2.5、Phi3 などのモデルを単一のコマンドで OpenAI 互換の API として実行できるようにします。

How it works

OpenLLMは、デフォルトのリポジトリまたはカスタムリポジトリからモデルを提供するための CLI ツールを提供します。最先端の推論バックエンド (such as vLLM) を活用し、BentoML と統合することで、プロダクショングレードの展開が可能になります。ユーザーは openllm serve を使用してローカルでサーバーを起動し、組み込みのチャット UI または CLI を介してモデルと対話できます。また、openllm deploy を使用して BentoCloud 経由でクラウドに展開できます。

Who it’s for

独自の LLM をローカルまたはクラウドでホストしたいが、プロプライエタリな API に依存せず、かつ OpenAI API 標準との互換性を維持したい開発者やエンタープライズ AI チーム。

Highlights

  • OpenAI-Compatible APIs: 既存のツールやフレームワーク (like LlamaIndex) がセルフホストされたモデルとシームレスに動作することを可能にします。
  • BentoCloud Integration: Docker と Kubernetes を使用した、エンタープライズグレードのクラウド展開のための簡素化されたワークフロー。
  • Extensive Model Support: 幅広いオープンソースモデルをサポートしています。 Llama, Mistral, Gemma, DeepSeek など。
  • Custom Model Repositories: 独自の、または専門的なモデルを実行するために、カスタムモデルリポジトリを追加する機能。
  • Built-in Chat UI: ホストされたモデルと即座にやり取りするための Web ベースのインターフェースが含まれています。