RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

解決的問題

Arbor 是一個為通用優化設計的自主研究代理。它透過採用結構化的假設樹框架,取代線性的試誤方式,解決了 AI 驅動實驗效率低下且易遺忘的問題。此框架使代理能優化任何具可測量指標的任務——例如模型訓練、資料合成或工程系統建構——同時確保所有改進皆在保留資料上經過驗證,防止過度擬合。

工作原理

Arbor 採用兩個協作的代理:Coordinator(研究主管)與 Executor(研究工程師)。

它們在六步「樹狀循環」中運作:

  1. 觀察:分析當前結果與失敗模式。
  2. 構思:基於假設樹提出新假設。
  3. 選擇:優先選擇最有前景的想法。
  4. 分派:Executor 在隔離的 git worktree 中實現變更,並在開發集上評估。
  5. 回溯傳播:記錄結果並抽象洞察向上傳遞至樹中,使未來想法可繼承這些經驗。
  6. 決策:使用保留驗證集決定是否將成果合併到主幹、剪枝分支或繼續探索。

Arbor 可作為原生 CLI 使用,也可透過 MCP 集成到其他編碼代理(如 Claude Code 或 Codex)中,或作為獨立技能套件運行。

適用對象

適用於需要優化複雜軟體或 ML 系統的研究人員與開發者,他們希望採用一種有紀律、自動化的實驗方法,同時保留成功與失敗的歷史記錄。

核心亮點

  • 假設樹:維護研究方向與具體方法的結構化歷史,避免重複錯誤。
  • 實驗紀律:使用隔離的 git worktree 與嚴格的開發/測試劃分,確保僅真實改進被合併。
  • 文獻基礎:整合 alphaXiv API,在消耗計算資源前檢查想法的新穎性。
  • 靈活整合:支援多種 LLM 後端(Anthropic、OpenAI、DeepSeek 等),可在其他 AI 編碼工具中無密鑰運行。
  • 可操控性:提供即時儀表板與多種互動模式(自動、指導、審查、協作),支援人類在環指導。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案