Dharma AI GPU 관리: 제약 조건 인식 할당을 통한 클러스터 활용도 향상

Dharma AI는 클러스터 활용도와 우선순위 가중 출력을 최적화하기 위해 제약 조건 인식 GPU 할당기를 도입했습니다. 하드웨어를 변경하는 대신 할당 결정의 순서를 변경함으로써, 이 시스템은 일곱 가지 벤치마크 시나리오에서 선입선출(FIFO) 스케줄러와 비교해 GPU 활용도를 최대 33%포인트, 우선순위 가중 출력을 최대 105% 향상시켰습니다.

핵심 문제: 호환되지 않는 워크로드 형태

GPU 스케줄링은 두 가지 본질적으로 다른 할당 형태 간의 경쟁으로 인해 복잡해집니다:

  1. 배치 유사 워크로드: 학습, 배치 추론, 양자화. 이러한 작업들은 완료될 때까지 중단 없이 연속적인 GPU 블록을 점유해야 합니다.
  2. 탄력적 워크로드: 실시간 추론. 이 작업은 시간 단위마다 변동하는 수요 곡선에 의해驱动됩니다.

이 서로 호환되지 않는 형태가 동일한 하드웨어를 경쟁할 때, 기존의 FIFO 스케줄러는 큰 비효율을 초래합니다. FIFO 스케줄러는 실시간 추론의 가용성을 보장하기 위해 고정 예약에 의존하는 경우가 많아, 교통 저조 시간 동안 GPU가 비활성 상태로 남아 배치 작업에 사용되지 않아 활용도가 낮아집니다.

제약 조건 인식 할당 vs. FIFO

FIFO 스케줄링은 두 가지 주요 방식으로 용량을 낭비합니다: 비정상적인 시간대에 GPU를 비활성 상태로 유지하는 정적 예약과, 작업 우선순위와 미래 용량 수요를 무시하는 순서 처리 방식입니다.

반면 Dharma AI 할당기는 실시간 수요를 한계가 아니라 곡선으로 간주합니다. 시스템은 각 시간 단위에서의 수요에 따라 GPU를 할당하고, 배치 유사 작업이 수요 저조 구간을 점유할 수 있도록 합니다. 안전성을 보장하기 위해, 시스템은 실시간 작업이 연속적인 시간 단위 간에 GPU를 교체할 수 있는 횟수에 하한을 설정합니다.

성능 벤치마크

다섯 가지 고경쟁 시나리오에서 할당기는 활용도와 우선순위 가중 값 모두 개선되었습니다:

  • 활용도: 52–85% 범위에서 72–88% 범위로 향상됨.
  • 우선순위 가중 값: 24.6%에서 105.1%까지 상승했으며, 평균 상승률은 52%입니다.

8개 GPU에서 학습 중심 워크로드를 실행한 경우, 활용도는 53.6%에서 87.0%로 상승했고, 값은 105% 증가했습니다. 특히 64개 GPU와 30개 작업을 사용한 스케일 테스트에서, FIFO 기준과 동일한 활용도(44.9%)와 처리량(30개 중 27개)을 유지하면서도 우선순위 가중 값이 15.9% 더 높았습니다. 이는 우선순위 인식 할당이 가치 생성에 핵심적임을 보여줍니다.

기술적 구현 및 제약 조건

지역 히우리스틱 규칙의 한계를 피하기 위해, 할당기는 다섯 가지 제약 조건을 기반으로 합법적인 할당을 정의하는 형식적 모델을 사용합니다:

  • 한 GPU는 한 시간 단위에 최대 한 개의 작업만 처리할 수 있습니다.
  • 모든 작업은 자신의 수요 범위를 준수하며, 실행 중인 작업은 상속되어 유지됩니다.
  • 배치 유사 작업은 GPU의 연속 블록을 점유하며(크기는 2의 거듭제곱으로 설정됩니다).
  • 실시간 작업은 연속적인 시간 단위 간 GPU 교체 횟수에 하한이 있습니다.
  • 시작된 작업은 중단될 수 없습니다.

목적 함수

시스템은 두 가지 항을 포함하는 목적 함수를 사용합니다: 배치 유사 작업에 GPU를 할당하는 보상(우선순위 × 시간 감소 가중치)과 실시간 수요를 충족하지 못했을 때의 벌점입니다. 실시간 벌점은 할당 보상보다 5~10배 더 무겁게 가중되며, 정적 예약 없이도 지연 의무를 배치 작업보다 우선시합니다.

히우리스틱 실행

조합적 할당은 NP-완전 문제이므로, 시스템은 핫 패스에서 히우리스틱을 사용하여 낮은 지연을 보장합니다. 경쟁이 있는 시나리오에서는 1~2밀리초 내에, 64개 GPU 클러스터에서는 15밀리초 내에 할당기가 실행되어, 모든 들어오는 요청에 대해 실행하기에 충분히 빠릅니다.

수요 예측 및 전문화

할당기의 효과성은 정확한 수요 예측에 달려 있습니다. Dharma AI는 다양한 워크로드 유형에 맞춘 전문화된 추정기들을 활용합니다:

  • 학습: 10개의 구체적인 학습 변형(예: LoRA vs. 전체 미세조정)을 포함한 22개 특징을 사용하는 예측기로, GPU 메모리와 지속 시간의 막대한 차이를 반영합니다.
  • 양자화: 매개변수 수와 알고리즘(예: AWQ, GPTQ)에 따라 캘리브레이션 계층을 기반으로 한 전용 예측기.
  • 실시간 추론: 시간당 트래픽 기록에서 재구성된 주간 수요 프로파일을 시간 단위로 지속적으로 재보정합니다.

운영 전략: 하루를 최적화하고, 시간을 확정하라

예측 오류를 완화하기 위해 스케줄러는 24시간 수평을 최적화하지만, 현재 시간 단위만 확정합니다. 시스템은 30~60분마다 재실행되어, 예측 오류를 재최적화를 통해 흡수함으로써 누적되지 않도록 합니다. 이 접근 방식은 최적화기가 수평을 넘어서 보지 못하기 때문에 현재 결정을 잘못 내리는 '세계 종말 효과'를 방지합니다.

Sources

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • Dispatch