RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

何を解決するか

Arborは汎用最適化向けに設計された自律型研究エージェントです。線形的な試行錯誤に代わり、構造化された仮説ツリー枠組みを採用することで、効率的で「記憶のない」AI駆動の実験の問題を解決します。このアプローチにより、モデルトレーニング、データ合成、ハーネス工学など、測定可能な指標を持つあらゆるタスクを最適化可能であり、過学習を防ぐために、ホールドアウトデータ上で成果が検証されます。

動作方法

Arborは2つの協調するエージェントを採用しています:Coordinator(研究ディレクター)と Executor(研究エンジニア)。

6ステップの「アーバー・サイクル」で動作します:

  1. 観察:現在の結果と失敗モードを分析。
  2. アイデア創出:アイデアツリーに基づいて新しい仮説を提示。
  3. 選定:最も有望なアイデアを優先順位付け。
  4. ディスパッチ:Executorが隔離されたgit worktreeで変更を実装し、開発用スプリットで評価。
  5. バックプロパゲーション:結果を記録し、洞察をツリー上部に抽象化して、将来のアイデアがそれを継承できるように。
  6. 決定:ホールドアウト検証を使用して、成果を本体にマージするか、枝を刈り取るか、継続するかを判断。

ArborはネイティブCLIとして使用可能で、MCPを介してClaude CodeやCodexなどの他のコーディングエージェントに統合可能、またはスタンドアロンのスキルセットとしても利用できます。

対象ユーザー

複雑なソフトウェアやMLシステムの最適化が必要で、実験の歴史を記録し、失敗と成功を明確に把握できる、体系的かつ自動化されたアプローチを求める研究者や開発者向けです。

特徴

  • 仮説ツリー:研究の方向性と具体的な手法の構造化された履歴を維持し、同じミスを繰り返さない。
  • 実験の厳格さ:隔離されたgit worktreeと厳密な開発/テスト分割を用いて、本物の改善のみがマージされるように保証。
  • 文献に基づく:alphaXiv APIと連携し、計算リソースを費やす前にアイデアの新規性を確認。
  • 柔軟な統合:Anthropic、OpenAI、DeepSeekなど複数のLLMバックエンドをサポートし、他のAIコーディングハーネス内でキーレスで実行可能。
  • 制御可能:ライブダッシュボードと複数の操作モード(自動、方向指示、レビュー、共同作業)を提供し、人間の指導を組み込むことが可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト