KMnO4-zx/agentic-rl-lab

Reproducing and studying RL algorithms for LLM agents, including GRPO, GSPO, DAPO, OPD, Search-R1, ReTool, ALFWorld and beyond.

解決的問題

本專案旨在簡潔地重現前沿的LLM強化學習(RL)演算法,降低研究Agentic-RL時的GPU和程式碼複雜性門檻。

運作原理

利用PyTRIO基礎設施,該儲存庫實作了一系列實驗記錄和教學。每個實作都包含對演算法起源、解決的問題及其核心變數的清晰說明,並附帶資料、獎勵、損失函數和訓練迴圈的可執行程式碼,以及透過SwanLab進行的實驗追蹤。

目標受眾

希望在沒有複雜基礎設施的情況下研究和實作前沿LLM RL及Agentic-RL方法的演算法工程師和研究人員。

主要特點

  • 廣泛的演算法覆蓋:重現多種方法,包括GRPO、OPD、OPSD、GSPO、DAPO、Search-R1、ReTool、ALFWorld、Vision GRPO和AgentOPSD。
  • 輕量級設計:專注於使用更簡單的程式碼和更低的硬體需求進行即時重現。
  • 多樣化的任務支援:包括數學推理(GSM8K)、醫療能力、多輪搜尋、程式碼交錯代理和基於視覺的幾何問題(GeoQA)的實作。
  • 環境整合:與TextWorld整合,用於在模擬家庭環境中訓練代理。

相關

  • 專案
  • 專案
  • 專案
  • 專案