yu-xin-c/Sea-mult-agent

A AutoResearch Agent

解決的問題

Sea-Mult-Agent (ScholarAgent) 是一個專為自動化科學研究任務而設計的多代理系統,特別聚焦於論文重現、使用自訂資料對基準倉儲進行評估,以及在預算限制下執行自動化研究(AutoResearch)。它解決了在固定資源預算內,手動反覆迭代程式碼修補、超參數與方法設定以尋找最佳結果的挑戰。

工作原理

該系統使用意圖路由器(Intent Router)與規劃器(Planner)將使用者目標轉換為經過驗證的有向無環圖(DAG)任務。隨後,調度器(Scheduler)將這些任務分配給專業代理:

  • 圖書館員(Librarian): 從論文中提取主張與方法,並凍結重現規範。
  • 程式設計師與研究程式設計代理(Coder & Research Coding Agent): 負責倉儲搜尋、相依性管理、程式碼除錯,以及為自訂資料產生程式碼修補或適配器。
  • 基準測試代理(Benchmark Agent): 管理資料分割(訓練/驗證/測試)、洩漏檢查,並使用隱藏標籤計算最終指標,防止過度擬合。
  • 沙盒(Sandbox): 一個基於 Go 的決定性服務,透過具備持久工作區的隔離 Docker 容器執行程式碼。
  • 研究優化器(Research Optimizer): 一個基於 Python 的元件,使用 UCB(上置信界)與 UCT 風格的樹狀搜尋(束搜尋)在參數樹之間分配預算,並選擇高價值候選方案。

適用對象

主要面向需要自動化重現 AI 論文、在自有專有資料集上評估現有倉儲,或在嚴格時間或資源限制下進行系統性消融研究與超參數優化的研究人員與開發者。

核心亮點

  • 預算限制下的自動研究: 實現雙層思維樹(ToT)與 UCT 風格搜尋,以在固定預算內優化方法與超參數。
  • 隔離執行環境: 使用專用 Go 沙盒服務在原生 Docker 容器中執行實驗,確保可靠性和回滾能力。
  • 主張-證據圖: 將論文主張與實際執行產物與指標連結,建構可視化證據圖以驗證重現。
  • 隱藏保留驗證: 透過基準代理在研究代理無法存取標籤的情況下計算最終指標,防止「作弊」行為。
  • 整合工作台: 提供基於 React 的 UI,用於監控 DAG 執行、透過 SSE 查看即時日誌,並分析實驗帳本。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案