rlresearch/dr-tulu

Official repository for DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

DR Tulu – 심층 연구를 위한 강화학습 에이전트

무엇인가요 – DR Tulu는 오픈소스 연구용 언어 모델(8 B 파라미터)과 심층 연구 에이전트를 훈련하고 실행하기 위한 코드를 제공하는 리포지토리입니다. 이 에이전트는 웹을 탐색하고 학술 API에 질의하며 과학적 질문에 대해 장문의 답변을 합성할 수 있습니다. 리포지토리는 다음 세 가지 구성 요소로 구성됩니다:

구성 요소 목적
agent/ MCP 기반 도구 백엔드, 고병렬 비동기 요청 처리, 유연한 프롬프팅 인터페이스를 구현한 라이브러리(dr‑agent‑lib). 또한 에이전트 평가를 위한 스크립트도 포함되어 있습니다.
rl/open‑instruct/ AllenAI의 Open‑Instruct 기반 강화학습 훈련 코드로, GRPO(정책 기반 기울기 알고리즘)와 진화하는 평가 기준을 사용하여 에이전트가 검색, 정보 획득, 추론하는 방법을 가르칩니다.
sft/llama‑factory/ LLaMA‑Factory 기반의 지도 미세조정 파이프라인으로, 원시적인 예시 데이터를 연구 능력을 갖춘 모델로 변환합니다.

빠른 시작: 인터랙티브 데모 (CLI)

  1. conda 환경 생성 및 에이전트 라이브러리 설치:
    cd agent/
    conda create -n dr_agent python=3.10 -y && conda activate dr_agent
    uv pip install -e .
    
  2. 에이전트가 호출할 수 있는 외부 도구(Serper, Semantic Scholar, Jina Reader)의 API 키 설정.
  3. 채팅 시작 (1~2개 GPU 필요):
    uv run --extra vllm python scripts/launch_chat.py --model rl-research/DR-Tulu-8B
    
    스크립트는 모델용 VLLM 서버와 도구 호출을 라우팅하는 MCP 서버를 자동으로 시작합니다. 이후 연구 스타일의 질문을 던지고, 에이전트가 웹을 탐색하고 논문을 검색하며 합성된 답변을 생성하는 모습을 관찰할 수 있습니다.

평가 실행

이 리포지토리는 HealthBench, Deep Research Bench, SimpleQA, Genetic Diseases, 2Wiki, WebWalker 등의 벤치마크를 위한 완전한 평가 환경을 제공합니다.

# 두 개의 VLLM 모델 서버 시작 (DR‑Tulu 및 비교 모델)
CUDA_VISIBLE_DEVICES=0 vllm serve rl-research/DR-Tulu-8B --dtype auto --port 30001 --max-model-len 40960
CUDA_VISIBLE_DEVICES=1 vllm serve Qwen/Qwen3-8B --dtype auto --port 30002 --max-model-len 40960

# MCP 도구 백엔드 시작
python -m dr_agent.mcp_backend.main --port 8000

서비스가 가동된 후, 원하는 작업에 대한 루프가 에이전트의 답변 생성을 수행하고, 이후 scripts/evaluate.py를 호출하여 벤치마크 점수를 계산합니다. 각 벤치마크별 상세 지침은 agent/evaluation/README.md에 있습니다.


훈련 파이프라인

  • 지도 미세조정 (SFT)sft/llama-factory/ 디렉터리를 사용합니다. 표준 LLaMA‑Factory 워크플로우를 따릅니다: JSONL 형식의 지시-응답 쌍을 준비하고, YAML을 구성한 후 1개 이상의 GPU에서 훈련을 시작합니다.
  • 강화학습 (RL)rl/open-instruct/를 사용합니다. 보상 모델을 훈련한 후, 진화하는 평가 기준을 사용한 GRPO를 실행하여 평가 기준을 점진적으로 엄격하게 하여, 검색 및 합성 행동의 개선을 유도합니다. 두 섹션 모두 정확한 명령줄 플래그, 데이터 형식 사양, 하이퍼파라미터 추천 사항을 포함한 자체 README 파일을 참조합니다.

누가 만들었나요?

이 프로젝트는 **앨런 연구소 for AI (AI2)**에서 주도하며, 워싱턴 대학교, 카네기 멜론 대학교, MIT의 학생들과 협력하여 개발되었습니다. 관련 논문(arXiv 2511.19399)은 DR Tulu‑8B가 장문 연구 벤치마크에서 OpenAI의 Deep Research 모델과 동등한 성능을 달성했다고 보고하고 있습니다.


인용 방법

@article{shao2025dr,
  title={DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research},
  author={Shao, Rulin and Asai, Akari and Shen, Shannon Zejiang and Ivison, Hamish and Kishore, Varsha and Zhuo, Jingming and Zhao, Xinran and Park, Molly and Finlayson, Samuel G and Sontag, David and others},
  journal={arXiv preprint arXiv:2511.19399},
  year={2025}
}

TL;DR

DR Tulu는 연구용 8 B 파라미터 언어 모델과 함께, 훈련(SFT + RL) 및 배포를 위한 완전한 스택을 제공합니다. 웹 탐색, 학술 API 질의, 인용이 풍부한 장문 답변 생성이 가능한 에이전트를 구현합니다. 리포지토리는 재사용 가능한 에이전트 라이브러리, 강화학습 훈련 코드, SFT 스크립트로 구성되며, 실행 가능한 평가 파이프라인과 인터랙티브 CLI 데모를 포함합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트