RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

解决的问题

Arbor 是一个为通用优化设计的自主研究代理。它通过采用结构化的假设树框架,取代线性的试错方式,解决了 AI 驱动实验效率低下且易遗忘的问题。该框架使代理能够优化任何具有可测量指标的任务——例如模型训练、数据合成或工程系统构建——同时确保所有改进都在保留数据上经过验证,防止过拟合。

工作原理

Arbor 采用两个协作的代理:Coordinator(研究主管)和 Executor(研究工程师)。

它们在六步「树状循环」中运作:

  1. 观察:分析当前结果和失败模式。
  2. 构思:基于假设树提出新假设。
  3. 选择:优先选择最有前景的想法。
  4. 分派:Executor 在隔离的 git worktree 中实现变更,并在开发集上评估。
  5. 回溯传播:记录结果并抽象洞察向上传递至树中,使未来想法可继承这些经验。
  6. 决策:使用保留验证集决定是否将成果合并到主干、剪枝分支或继续探索。

Arbor 可作为原生 CLI 使用,也可通过 MCP 集成到其他编码代理(如 Claude Code 或 Codex)中,或作为独立技能套件运行。

适用人群

适用于需要优化复杂软件或 ML 系统的研究人员和开发者,他们希望采用一种有纪律、自动化的实验方法,同时保留成功与失败的历史记录。

核心亮点

  • 假设树:维护研究方向和具体方法的结构化历史,避免重复错误。
  • 实验纪律:使用隔离的 git worktree 和严格的开发/测试划分,确保仅真实改进被合并。
  • 文献基础:集成 alphaXiv API,在消耗计算资源前检查想法的新颖性。
  • 灵活集成:支持多种 LLM 后端(Anthropic、OpenAI、DeepSeek 等),可在其他 AI 编码工具中无密钥运行。
  • 可操控性:提供实时仪表板和多种交互模式(自动、指导、审查、协作),支持人类在环指导。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目