RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

What it solves

Arbor 是一個為通用優化而設計的自主研究代理。它透過維持結構化的假設樹,解決了長期探索過程中「遺忘」失敗嘗試的問題。這使得它能優化任何具有可測量目標與指標的任務——例如模型訓練、資料合成或工程 harness——而不會在冗餘或失敗的想法上浪費計算資源。

How it works

Arbor 采用兩個協同工作的代理:Coordinator(研究主管)與 Executor(研究工程師)。

它們在六步「arbor cycle」中運作:

  1. Observe:分析當前結果與失敗模式。
  2. Ideate:根據 Idea Tree 提出新假設。
  3. Select:挑選最有前景的想法進行測試。
  4. Dispatch:Executor 在隔離的 git worktree 中實作想法,並在開發集上評估。
  5. Backpropagate:將結果與抽象洞見向上回傳至樹中。
  6. Decide:使用保留測試集決定是否將收益合併至主幹或剪除分支。

它可以作為獨立的 CLI 使用,亦可透過 MCP 整合至 Claude Code、Codex 等編碼代理,或作為獨立的技能套件。

Who it’s for

Arbor 為需要針對特定基準迭代優化程式碼或模型,且希望以有紀律且自動化的方式探索假設、避免對開發資料過度擬合的研究人員與開發者而建。

Highlights

  • Hypothesis Tree:維持結構化的洞見與失敗歷史,以指導未來探索。
  • Real Experiment Discipline:使用隔離的 git worktree 與保留驗證集,確保只有真正的改進會被合併。
  • Literature Grounding:整合 alphaXiv API,在投入計算資源前檢查想法的新穎性。
  • Flexible Deployment:支援多種 LLM 後端(Anthropic、OpenAI、DeepSeek 等),並直接整合至現有 AI 編碼 harness。
  • Steerable:提供即時儀表板與多種互動模式(auto、direction、review、collaborative),供人類在回路中指導。