basetenlabs/truss
The simplest way to serve AI/ML models in production
何を解決するか
Trussは、AI/MLモデルを本番環境にデプロイして提供するプロセスを簡素化します。手動でのコンテナ化、Dockerfileの作成、Kubernetesの設定の必要性を排除し、Hugging Face上のモデルから本番用APIエンドポイントへ迅速に移行できるようにします。
動作方法
Trussは、モデルコード、重み、依存関係をポータブルな形式にパッケージ化するCLIを提供します。ユーザーはconfig.yamlファイルで、ハードウェア(GPU)、モデル重み、推論エンジンなどのデプロイ仕様を定義します。その後、ツールはTensorRT-LLMの最適化やコンテナ化を含むビルドプロセスを処理し、モデルをBasetenや他のインフラストラクチャにデプロイします。
対象ユーザー
任意のPythonフレームワーク(PyTorch、TensorFlow、vLLM、transformersなど)からモデルをデプロイしたいMLエンジニアや開発者で、下位のインフラストラクチャやコンテナオーケストレーションを管理したくない人向けです。
主な特徴
- フレームワーク非依存: vLLM、SGLang、TensorRT-LLM、
transformers、diffusersなど、幅広いフレームワークをサポートしています。 - 迅速な反復: ライブリロードと「watch」モードを備え、完全な再ビルドなしにデプロイされたモデルに変更を同期できます。
- 構成の簡素化: YAMLベースの設定により、ハードウェアやモデル設定を指定でき、IDEでの自動補完と検証が可能です。
- 本番環境対応: GPU設定、シークレット、キャッシュ、オートスケーリングの組み込みサポートがあります。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト