rlresearch/dr-tulu
Official repository for DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
DR Tulu – 用于深度研究的强化学习代理
是什么 – DR Tulu 是一个开源的研究级语言模型(8 B 参数)及其配套代码,用于训练和运行 深度研究 代理。这些代理能够浏览网页、查询学术 API,并合成科学问题的长篇回答。该仓库包含三个部分:
| 组件 | 目的 |
|---|---|
agent/ |
一个库(dr‑agent‑lib),实现了基于 MCP 的工具后端、高并发异步请求处理以及灵活的提示接口。还包含用于基准测试代理的评估脚本。 |
rl/open‑instruct/ |
基于 AllenAI 的 Open‑Instruct 的强化学习训练代码,使用 GRPO(一种策略梯度算法)结合 动态演进的评分标准,教会代理如何搜索、检索和推理。 |
sft/llama‑factory/ |
基于 LLaMA‑Factory 的监督微调流水线,将原始演示数据转化为具备研究能力的模型,再进行强化学习。 |
快速开始:交互式演示(CLI)
- 创建 conda 环境 并安装代理库:
cd agent/ conda create -n dr_agent python=3.10 -y && conda activate dr_agent uv pip install -e . - 设置外部工具的 API 密钥,这些工具是代理可以调用的(Serper、Semantic Scholar、Jina Reader)。
- 启动聊天(需要 1–2 个 GPU):
该脚本会自动启动模型的 VLLM 服务器和路由工具调用的 MCP 服务器。然后您可以提出研究风格的问题,观察代理浏览网页、检索论文并生成合成答案的过程。uv run --extra vllm python scripts/launch_chat.py --model rl-research/DR-Tulu-8B
运行评估
该仓库提供了对 HealthBench、Deep Research Bench、SimpleQA、Genetic Diseases、2Wiki 和 WebWalker 等基准的完整评估工具链。
# 启动两个 VLLM 模型服务器(DR‑Tulu 和对比模型)
CUDA_VISIBLE_DEVICES=0 vllm serve rl-research/DR-Tulu-8B --dtype auto --port 30001 --max-model-len 40960
CUDA_VISIBLE_DEVICES=1 vllm serve Qwen/Qwen3-8B --dtype auto --port 30002 --max-model-len 40960
# 启动 MCP 工具后端
python -m dr_agent.mcp_backend.main --port 8000
服务启动后,循环执行所需任务,运行代理生成答案,然后调用 scripts/evaluate.py 计算基准分数。各基准的详细说明请参见 agent/evaluation/README.md。
训练流水线
- 监督微调(SFT) – 使用
sft/llama-factory/目录。遵循标准的 LLaMA‑Factory 工作流:准备 JSONL 格式的指令-响应对,配置 YAML 文件,并在一台或多台 GPU 上启动训练。 - 强化学习(RL) – 使用
rl/open-instruct/。代码先训练一个奖励模型,然后使用 动态演进的评分标准 运行 GRPO,逐步收紧评估标准,促使策略改进其搜索与合成行为。 两个部分均指向各自的 README 文件,提供精确的命令行标志、数据格式规范和超参数建议。
谁开发的?
该项目由 艾伦人工智能研究所(AI2) 主导,与华盛顿大学、卡内基梅隆大学和麻省理工学院的学生合作开发。相关论文(arXiv 2511.19399)描述了方法,并报告 DR Tulu‑8B 在长篇研究基准上与 OpenAI 的 Deep Research 模型表现相当。
如何引用
@article{shao2025dr,
title={DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research},
author={Shao, Rulin and Asai, Akari and Shen, Shannon Zejiang and Ivison, Hamish and Kishore, Varsha and Zhuo, Jingming and Zhao, Xinran and Park, Molly and Finlayson, Samuel G and Sontag, David and others},
journal={arXiv preprint arXiv:2511.19399},
year={2025}
}
TL;DR
DR Tulu 是一个研究级、8 B 参数的语言模型,以及一个完整的 训练(SFT + RL)和 部署 代理的堆栈,能够浏览网页、查询学术 API,并生成引用丰富的长篇回答。该仓库组织为可重用的代理库、强化学习训练代码和 SFT 脚本,并包含即用型评估流水线和交互式 CLI 演示。
相关
- 项目
- 项目
- 项目
- 项目