rlresearch/dr-tulu

Official repository for DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

DR Tulu – 用於深度研究的強化學習代理

是什麼 – DR Tulu 是一個開源的研究級語言模型(8 B 參數)及其配套程式碼,用於訓練與執行 深度研究 代理。這些代理能夠瀏覽網頁、查詢學術 API,並合成科學問題的長篇回答。該程式庫包含三個部分:

組件 目的
agent/ 一個庫(dr‑agent‑lib),實作了基於 MCP 的工具後端、高併發非同步請求處理,以及彈性提示介面。也包含用於基準測試代理的評估腳本。
rl/open‑instruct/ 基於 AllenAI 的 Open‑Instruct 的強化學習訓練程式碼,使用 GRPO(一種策略梯度演算法)結合 進化中的評分標準,教導代理如何搜尋、取得與推理。
sft/llama‑factory/ 基於 LLaMA‑Factory 的監督式微調流程,將原始示範資料轉換為具備研究能力的模型,再進行強化學習。

快速上手:互動式示範(CLI)

  1. 建立 conda 環境 並安裝代理程式庫:
    cd agent/
    conda create -n dr_agent python=3.10 -y && conda activate dr_agent
    uv pip install -e .
    
  2. 設定外部工具的 API 金鑰,這些工具是代理可呼叫的(Serper、Semantic Scholar、Jina Reader)。
  3. 啟動聊天(需要 1–2 個 GPU):
    uv run --extra vllm python scripts/launch_chat.py --model rl-research/DR-Tulu-8B
    
    腳本會自動啟動模型的 VLLM 伺服器與路由工具呼叫的 MCP 伺服器。隨後您可以提出研究風格的問題,觀察代理瀏覽網頁、檢索論文並生成合成答案的過程。

執行評估

該程式庫提供對 HealthBenchDeep Research BenchSimpleQAGenetic Diseases2WikiWebWalker 等基準的完整評估工具鏈。

# 啟動兩個 VLLM 模型伺服器(DR‑Tulu 和對比模型)
CUDA_VISIBLE_DEVICES=0 vllm serve rl-research/DR-Tulu-8B --dtype auto --port 30001 --max-model-len 40960
CUDA_VISIBLE_DEVICES=1 vllm serve Qwen/Qwen3-8B --dtype auto --port 30002 --max-model-len 40960

# 啟動 MCP 工具後端
python -m dr_agent.mcp_backend.main --port 8000

服務啟動後,循環執行所需任務,運行代理生成答案,然後呼叫 scripts/evaluate.py 計算基準分數。各基準的詳細說明請參見 agent/evaluation/README.md


訓練流程

  • 監督式微調(SFT) – 使用 sft/llama-factory/ 目錄。遵循標準的 LLaMA‑Factory 工作流程:準備 JSONL 格式的指令-回應對,設定 YAML 檔案,並在一台或多台 GPU 上啟動訓練。
  • 強化學習(RL) – 使用 rl/open-instruct/。程式碼先訓練一個獎勵模型,再使用 進化中的評分標準 執行 GRPO,逐步收緊評估標準,促使策略改善其搜尋與合成行為。 兩個部分均指向各自的 README 檔案,提供精確的命令列旗標、資料格式規範與超參數建議。

誰開發的?

此專案由 艾倫人工智能研究所(AI2) 主導,與華盛頓大學、卡內基梅隆大學和麻省理工學院的學生合作開發。相關論文(arXiv 2511.19399)描述了方法,並報告 DR Tulu‑8B 在長篇研究基準上與 OpenAI 的 Deep Research 模型表現相當。


如何引用

@article{shao2025dr,
  title={DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research},
  author={Shao, Rulin and Asai, Akari and Shen, Shannon Zejiang and Ivison, Hamish and Kishore, Varsha and Zhuo, Jingming and Zhao, Xinran and Park, Molly and Finlayson, Samuel G and Sontag, David and others},
  journal={arXiv preprint arXiv:2511.19399},
  year={2025}
}

TL;DR

DR Tulu 是一個研究級、8 B 參數的語言模型,以及一個完整的 訓練(SFT + RL)與 部署 代理的堆疊,能夠瀏覽網頁、查詢學術 API,並生成引用豐富的長篇回答。該程式庫組織為可重用的代理庫、強化學習訓練程式碼與 SFT 腳本,並包含即用型評估流程與互動式 CLI 示範。

相關

  • 專案
  • 專案
  • 專案
  • 專案