rlresearch/dr-tulu
Official repository for DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
DR Tulu – 用於深度研究的強化學習代理
是什麼 – DR Tulu 是一個開源的研究級語言模型(8 B 參數)及其配套程式碼,用於訓練與執行 深度研究 代理。這些代理能夠瀏覽網頁、查詢學術 API,並合成科學問題的長篇回答。該程式庫包含三個部分:
| 組件 | 目的 |
|---|---|
agent/ |
一個庫(dr‑agent‑lib),實作了基於 MCP 的工具後端、高併發非同步請求處理,以及彈性提示介面。也包含用於基準測試代理的評估腳本。 |
rl/open‑instruct/ |
基於 AllenAI 的 Open‑Instruct 的強化學習訓練程式碼,使用 GRPO(一種策略梯度演算法)結合 進化中的評分標準,教導代理如何搜尋、取得與推理。 |
sft/llama‑factory/ |
基於 LLaMA‑Factory 的監督式微調流程,將原始示範資料轉換為具備研究能力的模型,再進行強化學習。 |
快速上手:互動式示範(CLI)
- 建立 conda 環境 並安裝代理程式庫:
cd agent/ conda create -n dr_agent python=3.10 -y && conda activate dr_agent uv pip install -e . - 設定外部工具的 API 金鑰,這些工具是代理可呼叫的(Serper、Semantic Scholar、Jina Reader)。
- 啟動聊天(需要 1–2 個 GPU):
腳本會自動啟動模型的 VLLM 伺服器與路由工具呼叫的 MCP 伺服器。隨後您可以提出研究風格的問題,觀察代理瀏覽網頁、檢索論文並生成合成答案的過程。uv run --extra vllm python scripts/launch_chat.py --model rl-research/DR-Tulu-8B
執行評估
該程式庫提供對 HealthBench、Deep Research Bench、SimpleQA、Genetic Diseases、2Wiki 和 WebWalker 等基準的完整評估工具鏈。
# 啟動兩個 VLLM 模型伺服器(DR‑Tulu 和對比模型)
CUDA_VISIBLE_DEVICES=0 vllm serve rl-research/DR-Tulu-8B --dtype auto --port 30001 --max-model-len 40960
CUDA_VISIBLE_DEVICES=1 vllm serve Qwen/Qwen3-8B --dtype auto --port 30002 --max-model-len 40960
# 啟動 MCP 工具後端
python -m dr_agent.mcp_backend.main --port 8000
服務啟動後,循環執行所需任務,運行代理生成答案,然後呼叫 scripts/evaluate.py 計算基準分數。各基準的詳細說明請參見 agent/evaluation/README.md。
訓練流程
- 監督式微調(SFT) – 使用
sft/llama-factory/目錄。遵循標準的 LLaMA‑Factory 工作流程:準備 JSONL 格式的指令-回應對,設定 YAML 檔案,並在一台或多台 GPU 上啟動訓練。 - 強化學習(RL) – 使用
rl/open-instruct/。程式碼先訓練一個獎勵模型,再使用 進化中的評分標準 執行 GRPO,逐步收緊評估標準,促使策略改善其搜尋與合成行為。 兩個部分均指向各自的 README 檔案,提供精確的命令列旗標、資料格式規範與超參數建議。
誰開發的?
此專案由 艾倫人工智能研究所(AI2) 主導,與華盛頓大學、卡內基梅隆大學和麻省理工學院的學生合作開發。相關論文(arXiv 2511.19399)描述了方法,並報告 DR Tulu‑8B 在長篇研究基準上與 OpenAI 的 Deep Research 模型表現相當。
如何引用
@article{shao2025dr,
title={DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research},
author={Shao, Rulin and Asai, Akari and Shen, Shannon Zejiang and Ivison, Hamish and Kishore, Varsha and Zhuo, Jingming and Zhao, Xinran and Park, Molly and Finlayson, Samuel G and Sontag, David and others},
journal={arXiv preprint arXiv:2511.19399},
year={2025}
}
TL;DR
DR Tulu 是一個研究級、8 B 參數的語言模型,以及一個完整的 訓練(SFT + RL)與 部署 代理的堆疊,能夠瀏覽網頁、查詢學術 API,並生成引用豐富的長篇回答。該程式庫組織為可重用的代理庫、強化學習訓練程式碼與 SFT 腳本,並包含即用型評估流程與互動式 CLI 示範。
相關
- 專案
- 專案
- 專案
- 專案