basetenlabs/truss

The simplest way to serve AI/ML models in production

解決的問題

Truss 簡化了將 AI/ML 模型部署到生產環境並提供服務的流程。它消除了手動容器化、撰寫 Dockerfile 和設定 Kubernetes 的需求,讓開發者能從 Hugging Face 上的模型快速轉換至生產就緒的 API 端點。

運作方式

Truss 提供一個 CLI,將模型程式碼、權重與相依性打包成可攜式格式。使用者透過 config.yaml 檔案定義部署規格——例如硬體(GPU)、模型權重與推論引擎。接著,工具會處理建置流程,包含 TensorRT-LLM 優化與容器化,並將模型部署至 Baseten 或其他基礎設施。

適用對象

希望從任何 Python 框架(如 PyTorch、TensorFlow、vLLM 或 transformers)部署模型,但不想管理底層基礎設施或容器編排的 ML 工程師與開發者。

主要特色

  • 框架無關: 支援廣泛的框架,包括 vLLM、SGLang、TensorRT-LLM、transformersdiffusers
  • 快速迭代: 具備即時重新載入與「watch」模式,可在不進行完整重建的情況下同步變更至已部署的模型。
  • 設定簡化: 使用基於 YAML 的設定來指定硬體與模型設定,IDE 支援自動補完與驗證。
  • 生產就緒: 內建 GPU 設定、密碼、快取與自動擴展支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案