jiangxinke/Agentic-RAG-R1

Agentic RAG R1 Framework via Reinforcement Learning

它解决了什么问题

Agentic RAG‑R1 旨在提升语言模型在检索增强生成(RAG)系统中的推理与搜索能力。它针对模型在何时搜索信息、该检索什么以及如何将证据整合到最终答案中的困难提供解决方案。

它如何运作

此项目使用强化学习——具体而言是 GRPO(Generalized Relevance Policy Optimization)算法——来训练基础语言模型,使其能够自主处理搜索与推理循环。系统采用代理记忆栈,使模型能够执行推理、回溯、摘要以及使用搜索工具(如通过 ArtSearch 的 Wikipedia)等动作。它使用结合了准确性、格式以及 RAG‑specific 准确性(通过 RAGAS 框架)的奖励模型,来强化成功的行为。

目标对象

开发者和研究人员,特别是对构建能够执行复杂多步检索与推理任务的自主 AI 代理感兴趣的人;在医学等专业领域(如 MedQA 测试集结果所示)尤为适用。

亮点

  • 强化学习集成:使用 GRPO 提升搜索深度与答案质量。
  • 多步推理:在思考循环中支持推理、回溯与摘要。
  • 自定义工具集成:允许用户整合自己的工具和个人 RAG 数据集。
  • 资源高效:通过 LoRA 与量化(nf4)在两张 A100 GPU 上即可支持至 32B 参数的模型。
  • 分布式训练:兼容 DeepSpeed Zero 2 与 Zero 3 阶段。