basetenlabs/truss
The simplest way to serve AI/ML models in production
해결하는 문제
Truss는 AI/ML 모델을 프로덕션 환경에 배포하고 제공하는 과정을 간소화합니다. 수동 컨테이너화, Dockerfile 작성, Kubernetes 구성이 필요 없으며, Hugging Face의 모델에서 프로덕션 준비 완료된 API 엔드포인트로 빠르게 전환할 수 있습니다.
작동 방식
Truss는 모델 코드, 가중치, 종속성을 포터블한 형식으로 패키지화하는 CLI를 제공합니다. 사용자는 config.yaml 파일에서 하드웨어(GPU), 모델 가중치, 추론 엔진 등의 배포 사양을 정의합니다. 이후 도구는 TensorRT-LLM 최적화 및 컨테이너화를 포함한 빌드 프로세스를 처리하고, 모델을 Baseten 또는 기타 인프라로 배포합니다.
대상 사용자
PyTorch, TensorFlow, vLLM, transformers 등 어떤 Python 프레임워크에서든 모델을 배포하고 싶지만, 하위 인프라나 컨테이너 오케스트레이션을 관리하고 싶지 않은 ML 엔지니어 및 개발자입니다.
주요 특징
- 프레임워크 독립성: vLLM, SGLang, TensorRT-LLM,
transformers,diffusers등 다양한 프레임워크를 지원합니다. - 빠른 반복: 라이브 리로드 및 "watch" 모드를 통해 전체 재빌드 없이 배포된 모델에 변경 사항을 동기화할 수 있습니다.
- 구성 간소화: YAML 기반 설정을 사용하여 하드웨어 및 모델 설정을 지정할 수 있으며, IDE에서 자동 완성과 검증이 가능합니다.
- 프로덕션 준비 완료: GPU 설정, 시크릿, 캐싱, 오토스케일링을 내장된 지원 기능으로 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트