yu-xin-c/Sea-mult-agent

A AutoResearch Agent

해결하는 문제

Sea-Mult-Agent (ScholarAgent) 는 과학 연구 작업을 자동화하기 위해 설계된 다중 에이전트 시스템으로, 특히 논문 재현, 사용자 정의 데이터로 리포지토리 벤치마킹, 그리고 예산 제약 하의 자동 연구(AutoResearch)에 중점을 둡니다. 고정된 자원 예산 내에서 최적의 결과를 찾기 위해 코드 패치, 하이퍼파라미터, 메서드 구성에 대해 수동으로 반복적으로 시도하는 문제를 해결합니다.

작동 방식

이 시스템은 사용자 목표를 검증된 방향성 비순환 그래프(DAG) 작업으로 변환하는 Intent Router 및 Planner 를 사용합니다. 이후 Scheduler 는 이러한 작업을 전문 에이전트로 라우팅합니다:

  • Librarian (도서관원): 논문에서 주장과 방법을 추출하고 재현 룰을 고정합니다.
  • Coder & Research Coding Agent (코더 및 연구 코딩 에이전트): 리포지토리 탐색, 종속성 관리, 코드 디버깅, 사용자 정의 데이터용 코드 패치 또는 어댑터 생성을 담당합니다.
  • Benchmark Agent (벤치마크 에이전트): 데이터 분할(학습/검증/테스트), 누수 검사, 숨겨진 레이블을 사용하여 최종 메트릭을 계산하여 과적합을 방지합니다.
  • Sandbox (사전): 결정론적인 Go 기반 서비스로, 지속 가능한 워크스페이스를 갖춘 격리된 Docker 컨테이너에서 코드를 실행합니다.
  • Research Optimizer (연구 최적화 에이전트): Python 기반 컴포넌트로, UCB(상위 신뢰 구간) 및 UCT 스타일의 트리 탐색(빔 서치)을 사용하여 파라미터 트리 간에 예산을 할당하고 고가치 후보를 선택합니다.

대상 사용자

AI 논문의 재현을 자동화하고 싶은 연구자 및 개발자, 자체 기업 데이터셋에서 기존 리포지토리를 평가하고 싶은 사람, 또는 엄격한 시간 또는 자원 제약 하에서 체계적인 아블레이션 연구 및 하이퍼파라미터 최적화를 수행하고 싶은 사람들을 위한 것입니다.

주요 특징

  • 예산 제약 자동 연구: 고정된 예산 내에서 메서드와 하이퍼파라미터를 최적화하기 위해 이중 레이어의 Thought of Tree(ToT)와 UCT 스타일 탐색을 구현합니다.
  • 격리된 실행: 전용 Go 사전 서비스를 사용하여 네이티브 Docker 컨테이너에서 실험을 실행하여 신뢰성과 롤백 기능을 보장합니다.
  • 주장-증거 그래프: 논문 주장과 실제 실행 아티팩트 및 메트릭을 연결하여 재현 검증을 위한 시각적 증거 맵을 생성합니다.
  • 숨겨진 테스트 검증: 연구 에이전트가 레이블을 알 수 없도록 벤치마크 에이전트가 숨겨진 레이블로 최종 메트릭을 계산하여 "부정행위"를 방지합니다.
  • 통합 워크벤치: React 기반 UI를 통해 DAG 실행을 모니터링하고, SSE를 통해 실시간 로그를 확인하며 실험 레지스트리를 분석할 수 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트