yu-xin-c/Sea-mult-agent

A AutoResearch Agent

解决的问题

Sea-Mult-Agent (ScholarAgent) 是一个专为自动化科学研宄任务而设计的多代理系统,特别聚焦于论文复现、使用自定义数据对基准仓库进行评估,以及在预算约束下开展自动化研究(AutoResearch)。它解决了在固定资源预算内,手动迭代代码补丁、超参数和方法配置以寻找最优结果的挑战。

工作原理

该系统使用意图路由器(Intent Router)和规划器(Planner)将用户目标转换为经过验证的有向无环图(DAG)任务。随后,调度器(Scheduler)将这些任务分配给专业代理:

  • 图书管理员(Librarian): 从论文中提取主张和方法,并冻结复现规范。
  • 编码器与研究编码代理(Coder & Research Coding Agent): 负责仓库发现、依赖管理、代码调试,以及为自定义数据生成代码补丁或适配器。
  • 基准测试代理(Benchmark Agent): 管理数据划分(训练/验证/测试)、泄漏检查,并使用隐藏标签计算最终指标,防止过拟合。
  • 沙盒(Sandbox): 一个基于 Go 的确定性服务,通过带有持久工作区的隔离 Docker 容器执行代码。
  • 研究优化器(Research Optimizer): 一个基于 Python 的组件,使用 UCB(上置信界)和 UCT 风格的树搜索(束搜索)在参数树之间分配预算,并选择高价值候选方案。

适用人群

主要面向需要自动化复现 AI 论文、在自有专有数据集上评估现有仓库,或在严格的时间或资源限制下进行系统性消融研究和超参数优化的研究人员和开发者。

核心亮点

  • 预算约束下的自动研究: 实现双层思维树(ToT)和 UCT 风格搜索,以在固定预算内优化方法和超参数。
  • 隔离执行环境: 使用专用 Go 沙盒服务在原生 Docker 容器中运行实验,确保可靠性和回滚能力。
  • 主张-证据图: 将论文主张与实际执行产物和指标绑定,构建可视化证据图以验证复现。
  • 隐藏保留验证: 通过基准代理在研究代理无法访问标签的情况下计算最终指标,防止“作弊”行为。
  • 集成工作台: 提供基于 React 的 UI,用于监控 DAG 执行、通过 SSE 查看实时日志,并分析实验账本。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目