agentscope-ai/Trinity-RFT
Trinity-RFT is a general-purpose, flexible and scalable framework designed for reinforcement fine-tuning (RFT) of large language models (LLM).
解决的问题
Trinity-RFT 为大语言模型(LLM)的强化微调(RFT)提供了一个统一且灵活的框架。通过将经验生成、模型更新和数据管理解耦,简化了利用强化学习提升 LLM 能力的过程。
工作原理
该框架围绕三个核心组件构建:
- Explorer:处理智能体与环境的交互,生成经验数据。
- Trainer:基于收集的数据,通过最小化损失来更新模型权重。
- Buffer:管理数据流水线,负责在整个 RFT 生命周期中进行数据处理、清洗和增强。
支持多种 RFT 模式,包括同步/异步、在线/离线、策略/非策略强化学习,并允许在不同设备上独立扩展 rollout 和训练。
适用人群
- 希望为特定领域训练 LLM 驱动智能体的 智能体应用开发者。
- 希望使用即插即用模块实现并验证新 RL 算法的 强化学习研究人员。
- 专注于创建 RFT 数据集和构建复杂数据流水线(包括人机协同场景)的 数据工程师。
主要亮点
- 支持智能体强化学习:可直接训练智能体应用,包括多步骤工作流以及使用 AgentScope 等框架开发的应用。
- 全面的算法支持:实现多种算法,包括 PPO、GRPO、DPO、SFT,以及 CHORD 和 REC 等专用变体。
- 全生命周期数据流水线:支持主动数据管理,具备优先级、清洗功能,并原生支持多任务联合学习。
- 灵活的部署方式:支持 VLM 训练、LoRA,以及无本地 GPU 用户使用的 Tinker 后端。
相关
- 项目
- 项目
- 项目
- 项目
- 项目