jiangxinke/Harness-RL
Agentic RAG R1 Framework via Reinforcement Learning
解決的問題
Harness-RL 解決了在多智慧體系統(harness)中訓練語言模型智慧體時,無需將整個執行過程扁平化為單一長 token 序列的挑戰。它專門解決了當智慧體的動作和該動作的參數解耦時,如何正確歸因(梯度)的問題,從而在複雜的多智慧體環境中實現更高效的強化學習。
工作原理
該系統從介面呼叫和會話前綴樹構建「黑盒軌跡」。為了處理動作和參數的解耦,它使用衝突感知策略優化(CAPO)。該技術將來自動作 token 和參數 token 的梯度路由到各自的參數子空間,確保模型基於特定元件(動作或參數)的準確性進行更新,而不是基於通用的序列更新。
適用對象
該專案面向從事基於 LLM 的智慧體強化學習的 AI 研究人員和開發者,特別是那些構建協調多個專家智慧體的中央智慧體架構的人。
亮點
- 動作-參數解耦:避免扁平化執行序列,保持多智慧體互動的結構。
- 衝突感知策略優化(CAPO):一種專門的梯度路由機制,用於優化參數子空間。
- 靈活的訓練模式:支援僅訓練中央智慧體以及聯合訓練 harness 中的所有智慧體。
- 整合基礎設施:包括用於分散式 rollouts 的
slime、SGLang 服務和 Megatron 訓練。
相關
- 專案
- 專案
- 專案
- 專案
- 專案