jiangxinke/Harness-RL
Agentic RAG R1 Framework via Reinforcement Learning
해결하는 문제
Harness-RL은 멀티 에이전트 시스템(하네스) 내에서 언어 모델 에이전트를 훈련할 때 전체 실행 프로세스를 단일 긴 토큰 시퀀스로 평탄화할 필요 없이 처리하는 과제를 해결합니다. 특히 에이전트의 행동과 해당 행동의 인자가 분리된 경우 크레딧(그래디언트)을 올바르게 귀속시키는 문제를 해결하여 복잡한 멀티 에이전트 환경에서 더 효율적인 강화 학습을 가능하게 합니다.
작동 방식
이 시스템은 인터페이스 호출과 세션 접두사 트리에서 "블랙박스 궤적"을 구축합니다. 행동과 인자의 분리를 처리하기 위해 **Conflict-Aware Policy Optimization(CAPO)**을 사용합니다. 이 기술은 행동 토큰과 인자 토큰의 그래디언트를 각각의 매개변수 부분 공간으로 라우팅하여 모델이 일반적인 시퀀스 업데이트가 아닌 특정 구성 요소(행동 또는 인자)의 정확성에 기반하여 업데이트되도록 합니다.
대상 사용자
이 프로젝트는 LLM 기반 에이전트의 강화 학습을 연구하는 AI 연구자와 개발자, 특히 여러 전문 에이전트를 조정하는 중앙 에이전트 아키텍처를 구축하는 사람들을 위해 설계되었습니다.
주요 특징
- 행동-인자 분리: 실행 시퀀스의 평탄화를 방지하여 멀티 에이전트 상호작용의 구조를 유지합니다.
- Conflict-Aware Policy Optimization(CAPO): 매개변수 부분 공간을 최적화하기 위한 특수 그래디언트 라우팅 메커니즘.
- 유연한 훈련 모드: 중앙 에이전트만 훈련하거나 하네스 내 모든 에이전트를 공동 훈련하는 것을 모두 지원합니다.
- 통합 인프라: 분산 롤아웃을 위한
slime, SGLang 서빙, Megatron 훈련을 포함합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트