basetenlabs/truss

The simplest way to serve AI/ML models in production

解决的问题

Truss 简化了将 AI/ML 模型部署到生产环境并提供服务的过程。它消除了手动容器化、编写 Dockerfile 和配置 Kubernetes 的需求,使开发者能够从 Hugging Face 上的模型快速过渡到生产就绪的 API 端点。

工作原理

Truss 提供一个 CLI,将模型代码、权重和依赖项打包成可移植的格式。用户通过 config.yaml 文件定义部署规格——例如硬件(GPU)、模型权重和推理引擎。然后,该工具会处理构建过程,包括 TensorRT-LLM 优化和容器化,并将模型部署到 Baseten 或其他基础设施。

适用人群

希望从任意 Python 框架(如 PyTorch、TensorFlow、vLLM 或 transformers)部署模型,但不想管理底层基础设施或容器编排的 ML 工程师和开发者。

主要亮点

  • 框架无关性: 支持广泛的框架,包括 vLLM、SGLang、TensorRT-LLM、transformersdiffusers
  • 快速迭代: 支持实时重载和 "watch" 模式,可在不进行完整重建的情况下同步更改到已部署的模型。
  • 配置简化: 使用基于 YAML 的配置来指定硬件和模型设置,IDE 支持自动补全和验证。
  • 生产就绪: 内置 GPU 配置、密钥、缓存和自动扩展支持。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目