RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

What it solves

Arbor は汎用最適化のために設計された自律的な研究エージェントです。構造化された仮説ツリーを維持することで、長期的な探索中に失敗した試行を「忘れる」問題を解決します。これにより、モデル訓練、データ合成、ハーネスエンジニアリングなど、測定可能な目標と指標を持つあらゆるタスクを、冗長または失敗したアイデアに計算リソースを浪費することなく最適化できます。

How it works

Arbor は二つの協働エージェント、Coordinator(研究ディレクター)と Executor(研究エンジニア)を使用します。

それらは六段階の「arbor cycle」で動作します:

  1. Observe:現在の結果と失敗モードを分析。
  2. Ideate:Idea Tree に基づき新しい仮説を提案。
  3. Select:最も有望なアイデアを選択してテスト。
  4. Dispatch:Executor がアイデアを分離された git worktree に実装し、開発用データで評価。
  5. Backpropagate:結果と抽象的な洞察をツリー上方へ記録。
  6. Decide:保持されたテストデータで、成果をメインブランチにマージするか枝を刈り取るかを決定。

CLI として単体で使用でき、MCP 経由で Claude Code や Codex などのコーディングエージェントに統合したり、スタンドアロンのスキルスイートとして利用したりできます。

Who it’s for

Arbor は、特定のベンチマークに対してコードやモデルを反復的に最適化し、開発データへの過学習を避けながら仮説探索を自動化・体系的に行いたい研究者や開発者向けに構築されています。

Highlights

  • Hypothesis Tree:洞察と失敗の構造化された履歴を保持し、将来の探索を導く。
  • Real Experiment Discipline:分離された git worktree と保持された検証セットを使用し、真の改善のみがマージされることを保証。
  • Literature Grounding:alphaXiv API と統合し、計算リソースを投入する前にアイデアの新規性をチェック。
  • Flexible Deployment:Anthropic、OpenAI、DeepSeek など複数の LLM バックエンドに対応し、既存の AI コーディングハーネスに直接統合可能。
  • Steerable:ライブダッシュボードと複数のインタラクションモード(auto、direction、review、collaborative)を提供し、人間がループ内でガイダンスできるようにする。