RUC-NLPIR/Arbor

A generalist autonomous research agent — runs experiments, researches, and iteratively optimizes, autonomously.

해결하는 문제

Arbor는 일반 목적 최적화를 위한 자율 연구 에이전트입니다. 선형적인 시도-오류 방식을 대체하여 구조화된 가설 트리 프레임워크를 도입함으로써 비효율적이고 '기억력이 없는' AI 기반 실험의 문제를 해결합니다. 이는 모델 학습, 데이터 생성, 하드웨어 인프라 설계와 같은 측정 가능한 지표를 가진 모든 작업을 최적화할 수 있게 하며, 과적합을 방지하기 위해 검증 데이터셋에서 성능 향상 여부를 반드시 검증합니다.

작동 방식

Arbor는 두 가지 협력하는 에이전트를 사용합니다: Coordinator(연구 감독자)와 Executor(연구 엔지니어).

6단계의 '아보르 사이클'로 작동합니다:

  1. 관찰: 현재 결과와 실패 원인 분석.
  2. 아이디어 도출: 아이디어 트리 기반으로 새로운 가설 제안.
  3. 선택: 가장 유망한 아이디어 우선순위 정하기.
  4. 실행: Executor가 격리된 git worktree에서 변경 사항을 구현하고 개발용 데이터셋에서 평가.
  5. 역전파: 결과를 기록하고 통찰을 트리 상단으로 전파하여 미래 아이디어가 이를 계승할 수 있도록.
  6. 결정: 보류된 검증 데이터를 사용해 성과를 메인 브랜치에 병합할지, 가지를 잘라낼지, 계속할지 결정.

Arbor는 네이티브 CLI로 사용 가능하며, MCP를 통해 Claude Code나 Codex와 같은 다른 코딩 에이전트에 통합하거나, 독립형 기술 세트로도 활용할 수 있습니다.

대상 사용자

복잡한 소프트웨어나 ML 시스템을 최적화해야 하며, 실험의 기록(성공/실패)을 유지하는 체계적이고 자동화된 접근을 원하는 연구자 및 개발자에게 적합합니다.

주요 특징

  • 가설 트리: 연구 방향과 구체적인 방법의 구조화된 기록을 유지하여 같은 실수를 반복하지 않음.
  • 실험의 엄격성: 격리된 git worktree와 엄격한 개발/테스트 분할을 사용해 진정한 개선 사항만 병합됨.
  • 문헌 기반: alphaXiv API와 연동하여 계산 자원을 낭비하기 전에 아이디어의 독창성 확인.
  • 유연한 통합: Anthropic, OpenAI, DeepSeek 등 다양한 LLM 백엔드 지원 및 다른 AI 코딩 환경 내에서 키리스로 실행 가능.
  • 조정 가능: 실시간 대시보드와 자동, 방향 지시, 검토, 공동 작업 등 다양한 상호작용 모드를 제공하여 인간의 개입을 수월하게 통합.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트