yu-xin-c/Sea-mult-agent

A AutoResearch Agent

何を解決するか

Sea-Mult-Agent (ScholarAgent) は、科学的研究タスクを自動化するマルチエージェントシステムであり、特に論文の再現、カスタムデータでのベンチマークリポジトリの評価、および予算制約付きの自動研究(AutoResearch)に特化しています。固定されたリソース予算内で最適な結果を見つけるために、コードパッチ、ハイパーパラメータ、メソッド構成を手動で繰り返し試行する課題に対処します。

動作方法

このシステムは、ユーザーの目標を検証済みの有向非巡回グラフ(DAG)のタスクに変換する Intent Router と Planner を使用します。その後、Scheduler がこれらのタスクを専門的なエージェントにルーティングします:

  • Librarian(図書館員): 論文から主張と手法を抽出し、再現ルーブリックを固定します。
  • Coder & Research Coding Agent(コーダー&研究コーディングエージェント): リポジトリの発見、依存関係管理、コードデバッグ、カスタムデータ用のコードパッチまたはアダプタの生成を担当します。
  • Benchmark Agent(ベンチマークエージェント): データの分割(学習/検証/テスト)、リークチェック、および隠しラベルを使用して最終メトリクスを計算し、過学習を防ぎます。
  • Sandbox(サンドボックス): 決定論的なGoベースのサービスで、永続的なワークスペースを持つ隔離されたDockerコンテナ内でコードを実行します。
  • Research Optimizer(研究最適化エージェント): Pythonベースのコンポーネントで、UCB(上位信頼区間)とUCTスタイルの木探索(ビームサーチ)を使用して、パラメータツリー間で予算を割り当て、高価値の候補を選択します。

対象ユーザー

AI論文の再現を自動化したい研究者や開発者、自社の独自データセット上で既存のリポジトリを評価したい人、または厳格な時間やリソース制約の下で系統的なアブレーション研究やハイパーパラメータ最適化を実施したい人向けです。

特徴

  • 予算制約付き AutoResearch: 固定予算内でメソッドとハイパーパラメータを最適化するため、2層構造のThoughts of Tree(ToT)とUCTスタイルの探索を実装しています。
  • 隔離実行: 専用のGoサンドボックスサービスを使用して、ネイティブDockerコンテナ内で実験を実行し、信頼性とロールバック機能を確保します。
  • 主張から証拠へのグラフ: 論文の主張を実際の実行アーティファクトとメトリクスに紐づけ、再現検証用の視覚的証拠マップを構築します。
  • 隠しホールドアウト検証: ベンチマークエージェントが研究エージェントからラベルを隠して最終メトリクスを計算することで、「不正」を防ぎます。
  • 統合ワークベンチ: ReactベースのUIでDAGの実行をモニタリングでき、SSE経由でリアルタイムログを確認し、実験レジャーを分析できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト