jiangxinke/Harness-RL

Agentic RAG R1 Framework via Reinforcement Learning

解決的問題

Harness-RL 解決了在多智慧體系統(harness)中訓練語言模型智慧體時,無需將整個執行過程扁平化為單一長 token 序列的挑戰。它專門解決了當智慧體的動作和該動作的參數解耦時,如何正確歸因(梯度)的問題,從而在複雜的多智慧體環境中實現更高效的強化學習。

工作原理

該系統從介面呼叫和會話前綴樹構建「黑盒軌跡」。為了處理動作和參數的解耦,它使用衝突感知策略優化(CAPO)。該技術將來自動作 token 和參數 token 的梯度路由到各自的參數子空間,確保模型基於特定元件(動作或參數)的準確性進行更新,而不是基於通用的序列更新。

適用對象

該專案面向從事基於 LLM 的智慧體強化學習的 AI 研究人員和開發者,特別是那些構建協調多個專家智慧體的中央智慧體架構的人。

亮點

  • 動作-參數解耦:避免扁平化執行序列,保持多智慧體互動的結構。
  • 衝突感知策略優化(CAPO):一種專門的梯度路由機制,用於優化參數子空間。
  • 靈活的訓練模式:支援僅訓練中央智慧體以及聯合訓練 harness 中的所有智慧體。
  • 整合基礎設施:包括用於分散式 rollouts 的 slime、SGLang 服務和 Megatron 訓練。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案