yu-xin-c/Sea-mult-agent
A AutoResearch Agent
何を解決するか
Sea-Mult-Agent (ScholarAgent) は、科学的研究タスクを自動化するマルチエージェントシステムであり、特に論文の再現、カスタムデータでのベンチマークリポジトリの評価、および予算制約付きの自動研究(AutoResearch)に特化しています。固定されたリソース予算内で最適な結果を見つけるために、コードパッチ、ハイパーパラメータ、メソッド構成を手動で繰り返し試行する課題に対処します。
動作方法
このシステムは、ユーザーの目標を検証済みの有向非巡回グラフ(DAG)のタスクに変換する Intent Router と Planner を使用します。その後、Scheduler がこれらのタスクを専門的なエージェントにルーティングします:
- Librarian(図書館員): 論文から主張と手法を抽出し、再現ルーブリックを固定します。
- Coder & Research Coding Agent(コーダー&研究コーディングエージェント): リポジトリの発見、依存関係管理、コードデバッグ、カスタムデータ用のコードパッチまたはアダプタの生成を担当します。
- Benchmark Agent(ベンチマークエージェント): データの分割(学習/検証/テスト)、リークチェック、および隠しラベルを使用して最終メトリクスを計算し、過学習を防ぎます。
- Sandbox(サンドボックス): 決定論的なGoベースのサービスで、永続的なワークスペースを持つ隔離されたDockerコンテナ内でコードを実行します。
- Research Optimizer(研究最適化エージェント): Pythonベースのコンポーネントで、UCB(上位信頼区間)とUCTスタイルの木探索(ビームサーチ)を使用して、パラメータツリー間で予算を割り当て、高価値の候補を選択します。
対象ユーザー
AI論文の再現を自動化したい研究者や開発者、自社の独自データセット上で既存のリポジトリを評価したい人、または厳格な時間やリソース制約の下で系統的なアブレーション研究やハイパーパラメータ最適化を実施したい人向けです。
特徴
- 予算制約付き AutoResearch: 固定予算内でメソッドとハイパーパラメータを最適化するため、2層構造のThoughts of Tree(ToT)とUCTスタイルの探索を実装しています。
- 隔離実行: 専用のGoサンドボックスサービスを使用して、ネイティブDockerコンテナ内で実験を実行し、信頼性とロールバック機能を確保します。
- 主張から証拠へのグラフ: 論文の主張を実際の実行アーティファクトとメトリクスに紐づけ、再現検証用の視覚的証拠マップを構築します。
- 隠しホールドアウト検証: ベンチマークエージェントが研究エージェントからラベルを隠して最終メトリクスを計算することで、「不正」を防ぎます。
- 統合ワークベンチ: ReactベースのUIでDAGの実行をモニタリングでき、SSE経由でリアルタイムログを確認し、実験レジャーを分析できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト