Intelligent-Internet/zenith

Zenith: a continuous-improvement harness for long-running agent tasks. Turns Claude Code, Codex, or Hermes into a multi-agent mission orchestrator via MCP/ACP.

Zenith – 장기 실행 AI 코드 에이전트를 위한 하드웨어

무엇인가요 – Zenith는 대규모 언어 모델 기반 코드 에이전트(Claude Code, Codex, 또는 Hermes)가 조기 종료 없이 수일 또는 수주 동안 프로젝트를 지속적으로 수행할 수 있도록 해주는 Python 기반의 에이전트 하드웨어입니다. 이는 오케스트레이터를 실행함으로써 가능해지며, 작업의 현재 상태를 반복적으로 확인한 후 다음 중 하나를 결정합니다:

  • 코드를 작성하기 위한 워커 하위 에이전트 생성
  • 출력을 검증하기 위한 테스터 하위 에이전트 생성
  • 나중에 재사용 가능한 "스킬" 등록
  • 남은 작업 재계획
  • 작업이 진정으로 완료되었을 때만 중지

왜 중요한가요 – 장기적인 소프트웨어 엔지니어링 작업에서 가장 큰 실패 요인은 조기 종료입니다: 사양이 충족되지 않았음에도 불구하고 에이전트가 작업이 끝났다고 판단하는 경우입니다. Zenith의 적응형 루프(기존 RALPH 베이스라인에서 영감을 받음)는 프로세스를 지속적으로 유지하고, 갭을 재검토하며, 엄격한 규칙에 따라 작업이 완료되었을 때만 중지합니다. 저자들의 2026년 기술 보고서에 따르면, Zenith는 8개의 벤치마크 작업에서 다른 5가지 하드웨어 설계를 모두 상회하며, 가장 낮은 평균 순위를 기록했으며, 가장 강력한 베이스라인보다 비용의 절반 미만으로 운영되었습니다.


빠른 시작

옵션 1 – LLM이 설치를 도와주게 하기

README에 표시된 프롬프트를 Claude Code, Codex, 또는 Hermes에 복사하세요. 이 프롬프트는 다음을 수행합니다:

  1. 사용 중인 코드 에이전트를 감지합니다.
  2. uv를 사용하여 Python 종속성 설치.
  3. 필요한 ACP 어댑터(@agentclientprotocol/claude-agent-acp 또는 @agentclientprotocol/codex-acp) 설치.
  4. 이후 모든 명령을 하드웨어로 전달하는 /zenith 스킬 등록.

스킬이 생성된 후 단순히 다음을 입력하세요:

/zenith <your instruction>

Zenith이 작업을 이어받습니다.

옵션 2 – 수동 설치

# 리포지토리 복제 및 패키지 디렉터리로 이동
cd zenith
# Python 종속성 설치 (uv 필요) 및 CLI 설치
uv sync
# CLI 확인
uv run zenith --help

# 사용할 에이전트에 필요한 ACP 어댑터 설치
npm install -g @agentclientprotocol/claude-agent-acp   # Claude Code용
npm install -g @agentclientprotocol/codex-agent-acp   # Codex용

대상 코드베이스를 가리키는 워크스페이스 생성:

uv run zenith init --workspace-dir /path/to/your-app --agent claude   # 또는 codex

그런 다음, 지정된 워크스페이스에서 선택한 에이전트(예: claude 또는 codex)를 시작하고, README에 설명된 오케스트레이터 프롬프트를 입력합니다.


Zenith의 작동 방식 (개요)

  1. 오케스트레이터 세션 – 각 턴마다 프로젝트의 스냅샷(파일, 테스트 결과 등)을 읽는 단일 LLM 루프.
  2. 의사결정 단계 – 스냅샷 기반으로 다음 중 하나의 행동 선택: 워커 생성(코드 작성), 테스터 생성(테스트/검증), 재사용 가능한 스킬 등록, 남은 단계 재계획, 또는 정지.
  3. 서브에이전트 – 워커와 테스터는 MCP/ACP 프로토콜을 통해 격리된 컨텍스트에서 실행되며 결과를 오케스트레이터에 보고합니다.
  4. 통합 – 오케스트레이터는 서브에이전트 출력을 통합하고 프로젝트 상태를 업데이트한 후 반복합니다.
  5. 적응형 할당 – 오케스트레이터는 언제 더 많은 워커를 할당할지, 검증에 집중할지, 중지할지 학습하여 낭비되는 API 호출을 줄입니다.

보고된 성능

벤치마크 모델 하드웨어 평균 순위 (낮을수록 우수) 주도성 작업당 비용
Frontier SWE GPT‑5.5 Zenith 2.06 92 % $175.68
(다른 것들)

8개의 장기 작업에 대한 아블레이션 연구 결과:

  • 평균 순위: Zenith 1.38 vs. RALPH 1.75
  • 평균 비용: $175.68 vs. RALPH $407.58
  • 승리 수: Zenith는 8개 작업 중 5개에서 승리, 다른 모든 방법보다 가장 많음

리포지토리 구조

  • zenith/ – Python 패키지(zenith-harness), CLI 진입점, MCP 서버, 번들된 프롬프트/스킬, 테스트 포함.
  • technical_report/From RALPH to Zenith 기술 보고서의 PDF, LaTeX 소스, 그림 파일.

누구에게 적합한가요

  • AI 보조 소프트웨어 엔지니어 – 대규모 기능 또는 리팩터링을 수일간 자동으로 완료시키고 싶은 사람.
  • 연구자 – 장기 실행 에이전트의 제어 메커니즘(갭 탐지, 적응형 오케스트레이션, 정지 규칙)을 탐구하고 싶은 사람.
  • 도구 개발자 – ACP 프로토콜을 통해 Claude Code, Codex, 또는 Hermes에 연결 가능한 재사용 가능한 하드웨스가 필요한 사람.

라이선스

  • 코드: Apache 2.0
  • 보고서 및 그림: Creative Commons BY 4.0

인용 (리포지토리에 제공된 것):

@techreport{ii2026zenith,
  title       = {From RALPH to Zenith: Designing Harnesses for Long-Running Agents},
  author      = {{Intelligent Internet}},
  institution = {Intelligent Internet},
  year        = {2026},
  type        = {Technical Report},
  url         = {https://github.com/Intelligent-Internet/zenith}
}

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트