meta-pytorch/torchforge

PyTorch-native post-training at scale

해결하는 문제

강화 학습(RL) 연구에서 인프라 관리의 복잡성을 제거합니다. 모델 로직을 기반이 되는 하드웨어 및 통신 패턴과 분리함으로써, 연구자는 분산 시스템이나 GPU 배치에 대한 전문가가 아니더라도 RL 알고리즘 개발에 집중할 수 있습니다.

작동 방식

Torchforge는 명확한 RL 추상화 세트와 이러한 추상화의 확장 가능한 구현을 제공합니다. 사용자는 수천 개의 GPU에 걸쳐 비동기 및 동기 훈련을 전환할 수 있으며, 장애 처리, 훈련 부하 재전송 및 통신 패턴에 대한 세밀한 제어가 필요한 파워 유저를 위한 저수준 프리미티브도 제공합니다.

대상 사용자

몇 개의 GPU에서 수천 개의 GPU까지 확장 가능한 에이전트형 RL을 위한 확장 가능한 PyTorch 네이티브 라이브러리가 필요한 RL 연구자 및 파워 유저를 위해 설계되었습니다.

주요 특징

  • 인프라 추상화: RL 루프를 기반 인프라로부터 격리하여 연구 속도를 높입니다.
  • 높은 확장성: 비동기 및 동기 훈련 사이를 전환할 수 있는 유연성을 갖추고 수천 개의 GPU에 걸친 확장을 지원합니다.
  • 해킹 가능성: 인프라 계층과 상호 작용할 필요 없이 RL 루프의 모든 부분을 수정할 수 있습니다.
  • PyTorch 네이티브: ROCm 지원, vLLM 및 torchtitan과의 통합을 포함하여 PyTorch 생태계와 깊게 통합되도록 구축되었습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트