meta-pytorch/torchforge
PyTorch-native post-training at scale
解决的问题
它消除了强化学习 (RL) 研究中基础设施管理的复杂性。通过将模型逻辑与底层硬件及通信模式分离,研究人员无需成为分布式系统或 GPU 放置方面的专家,即可专注于开发 RL 算法。
工作原理
Torchforge 提供了一套清晰的 RL 抽象及其可扩展的实现。它允许用户在数千个 GPU 上进行异步和同步训练之间的切换,同时还为需要对故障处理、训练负载重定向和通信模式进行精细控制的高级用户提供底层原语。
适用对象
专为 RL 研究人员和高级用户设计,他们需要一个可扩展的、PyTorch 原生的代理 RL 库,能够从少量 GPU 扩展到数千个 GPU。
亮点
- 基础设施抽象:将 RL 循环与底层基础设施隔离,以加速研究。
- 高扩展性:支持跨数千个 GPU 的扩展,并具有在异步和同步训练之间切换的灵活性。
- 可修改性 (Hackability):无需与基础设施层交互即可修改 RL 循环的所有部分。
- PyTorch 原生:旨在与 PyTorch 生态系统深度集成,包括支持 ROCm 以及与 vLLM 和 torchtitan 的集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目