bentoml/BentoML

The easiest way to serve AI apps and models - Build Model Inference APIs, Job queues, LLM apps, Multi-model pipelines, and more!

What it solves

BentoML は、AI/ML モデルを本番環境向けの推論 API に変換するプロセスを簡素化します。"依存関係の地獄" を排除し、高性能サービングシステムの構築の複雑さを取り除くことで、開発者はモデルがどのフレームワークやモダリティで作られたかに関係なくデプロイできるようになります。

How it works

BentoML は Python ライブラリで、ユーザーは service.py ファイル内で標準的な Python 型ヒントを用いてモデルサービングロジックを定義できます。これらのサービスを「Bento」と呼ばれる標準化されたデプロイ可能アーティファクトにパッケージ化するツールセットを提供し、さらに自動的に Docker コンテナイメージへ変換して任意の環境へデプロイしたり、BentoCloud で管理したりできます。

Who it’s for

オープンソースまたはカスタム AI モデル向けに、スケーラブルで高性能なモデル推論 API を構築・パッケージ化・デプロイする必要がある AI/ML エンジニア向けです。

Highlights

  • Framework Agnostic: すべての機械学習フレームワーク、モダリティ、推論ランタイムをサポート。
  • Serving Optimizations: 動的バッチング、モデル並列化、マルチステージパイプラインオーケストレーションなどの組み込み機能により、CPU/GPU の利用率を最大化。
  • Simplified Deployment: シンプルな設定ファイルで Docker イメージを自動生成し、環境と依存関係を管理。
  • Flexible Orchestration: マルチモデル推論グラフのオーケストレーションとカスタムビジネスロジックの実装をサポート。