KMnO4-zx/agentic-rl-lab
Reproducing and studying RL algorithms for LLM agents, including GRPO, GSPO, DAPO, OPD, Search-R1, ReTool, ALFWorld and beyond.
解決的問題
本專案旨在簡潔地重現前沿的LLM強化學習(RL)演算法,降低研究Agentic-RL時的GPU和程式碼複雜性門檻。
運作原理
利用PyTRIO基礎設施,該儲存庫實作了一系列實驗記錄和教學。每個實作都包含對演算法起源、解決的問題及其核心變數的清晰說明,並附帶資料、獎勵、損失函數和訓練迴圈的可執行程式碼,以及透過SwanLab進行的實驗追蹤。
目標受眾
希望在沒有複雜基礎設施的情況下研究和實作前沿LLM RL及Agentic-RL方法的演算法工程師和研究人員。
主要特點
- 廣泛的演算法覆蓋:重現多種方法,包括GRPO、OPD、OPSD、GSPO、DAPO、Search-R1、ReTool、ALFWorld、Vision GRPO和AgentOPSD。
- 輕量級設計:專注於使用更簡單的程式碼和更低的硬體需求進行即時重現。
- 多樣化的任務支援:包括數學推理(GSM8K)、醫療能力、多輪搜尋、程式碼交錯代理和基於視覺的幾何問題(GeoQA)的實作。
- 環境整合:與TextWorld整合,用於在模擬家庭環境中訓練代理。
相關
- 專案
- 專案
- 專案
- 專案