jiangxinke/Harness-RL

Agentic RAG R1 Framework via Reinforcement Learning

解决的问题

Harness-RL 解决了在多智能体系统(harness)中训练语言模型智能体时,无需将整个执行过程扁平化为单个长 token 序列的挑战。它专门解决了当智能体的动作和该动作的参数解耦时,如何正确归因(梯度)的问题,从而在复杂的多智能体环境中实现更高效的强化学习。

工作原理

该系统从接口调用和会话前缀树构建“黑盒轨迹”。为了处理动作和参数的解耦,它使用冲突感知策略优化(CAPO)。该技术将来自动作 token 和参数 token 的梯度路由到各自的参数子空间,确保模型基于特定组件(动作或参数)的准确性进行更新,而不是基于通用的序列更新。

适用对象

该项目面向从事基于 LLM 的智能体强化学习的 AI 研究人员和开发者,特别是那些构建协调多个专家智能体的中央智能体架构的人。

亮点

  • 动作-参数解耦:避免扁平化执行序列,保持多智能体交互的结构。
  • 冲突感知策略优化(CAPO):一种专门的梯度路由机制,用于优化参数子空间。
  • 灵活的训练模式:支持仅训练中央智能体以及联合训练 harness 中的所有智能体。
  • 集成基础设施:包括用于分布式 rollouts 的 slime、SGLang 服务和 Megatron 训练。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目