jiangxinke/Agentic-RAG-R1
Agentic RAG R1 Framework via Reinforcement Learning
해결하고자 하는 문제
Agentic RAG‑R1은 Retrieval‑Augmented Generation(RAG) 시스템에서 언어 모델의 추론 및 검색 능력을 개선하는 것을 목표로 합니다. 모델이 언제 정보를 검색해야 하는지, 무엇을 가져와야 하는지, 그리고 그 증거를 최종 답변에 어떻게 통합할지 결정하는 데 어려움을 겪는 한계를 해결합니다.
작동 방식
이 프로젝트는 강화학습, 특히 GRPO(Generalized Relevance Policy Optimization) 알고리즘을 사용해 기본 언어 모델을 자율적으로 검색·추론 루프를 처리하도록 훈련합니다. 시스템은 에이전트 메모리 스택을 활용해 모델이 추론, 백트래킹, 요약 및 검색 도구(ArtSearch를 통한 Wikipedia 등) 사용과 같은 행동을 수행할 수 있게 합니다. 정확도, 포맷, RAG‑specific 정확도(RAGAS 프레임워크 활용)를 결합한 보상 모델을 사용해 성공적인 행동을 강화합니다.
대상
복잡하고 다단계 검색·추론 작업을 수행할 수 있는 자율 AI 에이전트를 구축하고자 하는 개발자와 연구자를 위한 프로젝트이며, 특히 의료 분야와 같이 전문 도메인(예: MedQA 테스트 세트 결과)에서 유용합니다.
주요 특징
- 강화학습 통합: GRPO를 사용해 검색 깊이와 답변 품질을 향상.
- 다단계 추론: 숙고 루프 내에서 추론, 백트래킹, 요약 지원.
- 맞춤형 도구 통합: 사용자가 자체 도구와 개인 RAG 데이터셋을 통합 가능.
- 자원 효율성: LoRA와 양자화(nf4)를 통해 두 대의 A100 GPU만으로 최대 32B 파라미터 모델 지원.
- 분산 학습: DeepSpeed Zero 2 및 Zero 3 단계와 호환.