RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

What it solves

Arbor 是一个为通用优化设计的自主研究代理。它通过维护结构化的假设树,解决了长期探索过程中“遗忘”失败尝试的问题。这使得它能够优化任何具有可测量目标和指标的任务——例如模型训练、数据合成或工程 harness——而不会在冗余或失败的想法上浪费计算资源。

How it works

Arbor 采用两个协同工作的代理:Coordinator(研究主管)和 Executor(研究工程师)。

它们在六步“arbor cycle”中运作:

  1. Observe:分析当前结果与失败模式。
  2. Ideate:根据 Idea Tree 提出新假设。
  3. Select:挑选最有前景的想法进行测试。
  4. Dispatch:Executor 在隔离的 git worktree 中实现想法,并在开发集上评估。
  5. Backpropagate:将结果与抽象洞见向上回传至树中。
  6. Decide:使用保留测试集决定是否将收益合并至主干或剪除分支。

它可以作为独立的 CLI 使用,也可通过 MCP 集成到 Claude Code、Codex 等编码代理,或作为独立的技能套件。

Who it’s for

Arbor 为需要针对特定基准迭代优化代码或模型,且希望以有纪律且自动化的方式探索假设、避免对开发数据过度拟合的研究人员和开发者而构建。

Highlights

  • Hypothesis Tree:维护结构化的洞见与失败历史,以指导未来探索。
  • Real Experiment Discipline:使用隔离的 git worktree 与保留验证集,确保只有真正的改进会被合并。
  • Literature Grounding:整合 alphaXiv API,在投入计算资源前检查想法的新颖性。
  • Flexible Deployment:支持多种 LLM 后端(Anthropic、OpenAI、DeepSeek 等),并直接集成到现有 AI 编码 harness。
  • Steerable:提供实时仪表板与多种交互模式(auto、direction、review、collaborative),供人类在回路中指导。