RUC-NLPIR/Arbor
A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.
何を解決するか
Arborは汎用最適化向けに設計された自律型研究エージェントです。線形的な試行錯誤に代わり、構造化された仮説ツリー枠組みを採用することで、効率的で「記憶のない」AI駆動の実験の問題を解決します。このアプローチにより、モデルトレーニング、データ合成、ハーネス工学など、測定可能な指標を持つあらゆるタスクを最適化可能であり、過学習を防ぐために、ホールドアウトデータ上で成果が検証されます。
動作方法
Arborは2つの協調するエージェントを採用しています:Coordinator(研究ディレクター)と Executor(研究エンジニア)。
6ステップの「アーバー・サイクル」で動作します:
- 観察:現在の結果と失敗モードを分析。
- アイデア創出:アイデアツリーに基づいて新しい仮説を提示。
- 選定:最も有望なアイデアを優先順位付け。
- ディスパッチ:Executorが隔離されたgit worktreeで変更を実装し、開発用スプリットで評価。
- バックプロパゲーション:結果を記録し、洞察をツリー上部に抽象化して、将来のアイデアがそれを継承できるように。
- 決定:ホールドアウト検証を使用して、成果を本体にマージするか、枝を刈り取るか、継続するかを判断。
ArborはネイティブCLIとして使用可能で、MCPを介してClaude CodeやCodexなどの他のコーディングエージェントに統合可能、またはスタンドアロンのスキルセットとしても利用できます。
対象ユーザー
複雑なソフトウェアやMLシステムの最適化が必要で、実験の歴史を記録し、失敗と成功を明確に把握できる、体系的かつ自動化されたアプローチを求める研究者や開発者向けです。
特徴
- 仮説ツリー:研究の方向性と具体的な手法の構造化された履歴を維持し、同じミスを繰り返さない。
- 実験の厳格さ:隔離されたgit worktreeと厳密な開発/テスト分割を用いて、本物の改善のみがマージされるように保証。
- 文献に基づく:alphaXiv APIと連携し、計算リソースを費やす前にアイデアの新規性を確認。
- 柔軟な統合:Anthropic、OpenAI、DeepSeekなど複数のLLMバックエンドをサポートし、他のAIコーディングハーネス内でキーレスで実行可能。
- 制御可能:ライブダッシュボードと複数の操作モード(自動、方向指示、レビュー、共同作業)を提供し、人間の指導を組み込むことが可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト