jiangxinke/Agentic-RAG-R1
Agentic RAG R1 Framework via Reinforcement Learning
它解決了什麼問題
Agentic RAG‑R1 旨在提升語言模型在檢索增強生成(RAG)系統中的推理與搜尋能力。它針對模型在何時搜尋資訊、該檢索什麼以及如何將證據整合到最終答案中的困難提供解決方案。
它如何運作
此專案使用強化學習——具體而言是 GRPO(Generalized Relevance Policy Optimization)演算法——來訓練基礎語言模型,使其能自主處理搜尋與推理迴圈。系統採用代理記憶堆疊,使模型能執行推理、回溯、摘要以及使用搜尋工具(如透過 ArtSearch 的 Wikipedia)等動作。它使用結合了正確性、格式以及 RAG‑specific 正確性(透過 RAGAS 框架)的獎勵模型,來強化成功的行為。
目標對象
開發者與研究人員,特別是對構建能執行複雜多步檢索與推理任務的自主 AI 代理感興趣的人;在醫學等專業領域(如 MedQA 測試集結果所示)尤為適用。
重點特色
- 強化學習整合:使用 GRPO 提升搜尋深度與答案品質。
- 多步推理:在思考迴圈中支援推理、回溯與摘要。
- 自訂工具整合:允許使用者整合自有工具與個人 RAG 資料集。
- 資源效率:透過 LoRA 與量化(nf4)在兩張 A100 GPU 上即可支援至 32B 參數的模型。
- 分散式訓練:相容於 DeepSpeed Zero 2 與 Zero 3 階段。