meta-pytorch/torchforge

PyTorch-native post-training at scale

解決的問題

它消除了強化學習 (RL) 研究中基礎設施管理的複雜性。透過將模型邏輯與底層硬體及通訊模式分離,研究人員無需成為分散式系統或 GPU 配置方面的專家,即可專注於開發 RL 演算法。

工作原理

Torchforge 提供了一套清晰的 RL 抽象及其可擴展的實作。它允許使用者在數千個 GPU 上進行非同步與同步訓練之間的切換,同時還為需要對故障處理、訓練負載重定向和通訊模式進行精細控制的高級使用者提供低階原語。

適用對象

專為 RL 研究人員和高級使用者設計,他們需要一個可擴展的、PyTorch 原生的代理 RL 函式庫,能夠從少量 GPU 擴展到數千個 GPU。

亮點

  • 基礎設施抽象:將 RL 迴圈與底層基礎設施隔離,以加速研究。
  • 高擴展性:支持跨數千個 GPU 的擴展,並具有在非同步與同步訓練之間切換的靈活性。
  • 高可修改性 (Hackability):無需與基礎設施層互動即可修改 RL 迴圈的所有部分。
  • PyTorch 原生:旨在與 PyTorch 生態系統深度整合,包括支援 ROCm 以及與 vLLM 和 torchtitan 的整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案