ai-dynamo/aiconfigurator

Offline optimization of your disaggregated Dynamo graph

해결하는 문제

분산형 LLM 서빙을 위한 LLM 배포 구성은 사용자가 프리필 및 디코드 워커 수, 병렬성 설정, SLA 목표(예: 최초 토큰까지의 시간, 출력 토큰당 시간)를 균형 있게 조정하여 지연 시간을 희생시키지 않고 최대 스루풋을 달성해야 하기 때문에 복잡합니다.

작동 방식

AIConfigurator는 특정 하드웨어와 프레임워크에 대한 수집된 성능 데이터를 사용하여 LLM 추론을 모델링합니다. 사용자의 모델, GPU 수, GPU 유형에 따라 수천 가지 가능한 구성 중 최적의 설정을 탐색합니다. 다음과 같은 여러 모드로 작동할 수 있습니다:

  • 기본: 집약형 vs. 분산형 배포를 비교하여 최적의 전반적인 구성 찾기.
  • 추천: 특정 성능 목표를 달성하기 위해 필요한 최소 GPU 수를 계산하는 구매 도구로 작동.
  • 생성: 전체 파라미터 스윕 없이 빠르게 기본 구성 생성.
  • Exp: YAML 파일로 정의된 사용자 지정 실험 실행.

대상 사용자

Dynamo 또는 llm-d를 사용하여 엄격한 지연 SLA를 충족하면서 가능한 한 높은 스루풋을 달성해야 하는 ML 엔지니어 및 인프라 아키텍트.

주요 기능

  • 다중 백엔드 지원: trtllm, vllm, sglang와 호환.
  • 자동 탐색: 수천 가지 구성 평가를 통해 스루풋 대 지연의 파레토 경계를 찾음.
  • 배포 아티팩트 생성: Dynamo 매니페스트, llm-d Helm/Kustomize, FPM 등 다양한 타겟용 구성 파일 생성.
  • 구매 규모 추천: 특정 요청률과 SLA를 달성하기 위해 필요한 최소 하드웨어 추천.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트