Prime Agent 자기 개선형 RLM 하네스 출시

핵심 요약

Prime Intellect가 출시한 Prime Agent는 재귀적 언어 모델(Recursive Language Model, RLM) 실행과 CRUD 스타일의 지속적 하네스를 결합한 자기 개선형 코딩 하네스를 도입합니다. 이를 통해 임의 길이의 세션, 지속적인 서브 에이전트, 실시간 프롬프트/기술 업데이트가 가능합니다. ARC-AGI-3에서 95.5% RHAE Best@1을 달성하며 인간 전문가 기준치를 능가했으며, 다양한 롱 컨텍스트(long-context) 벤치마크에서 강력한 결과를 보여주었습니다.


핵심 추상화: RLM 및 지속적 하네스

RLM은 모델의 컨텍스트를 가변 변수로 취급합니다. 에이전트는 지속적인 IPython REPL 내에서 실행되어, 자신의 기록을 읽고 쓸 수 있으며, 서브 에이전트를 생성하고, 일반적인 Python 함수처럼 도구를 호출할 수 있습니다. 이 REPL 기반 설계는 이전 하네스들의 고정된 도구 호출 스키마를 제거하고, 모델이 이전 변수에 대한 액세스를 잃지 않으면서 임의의 길이의 프로그램을 실행할 수 있게 합니다.

지속적 하네스(Continual Harness)는 하네스 상태를 CRUD 가능하게 만듭니다. 하네스의 프롬프트, 기술, 메모리 항목 및 서브 에이전트 사양은 rlm.harness에 저장되며 런타임에 생성, 읽기, 업데이트 또는 삭제할 수 있습니다. 각 편집 사항은 디스크에 영구 저장되어 커널 재시작 후에도 유지되며, 개선 이력을 통해 롤백할 수 있습니다.

두 추상화는 모델이 직접 호출할 수 있는 작은 Python API(예: rlm.harness.create_skill(...), await rlm("task"))를 통해 노출됩니다.


아키텍처 개요

  • **백그라운드 데몬(Background daemon)**은 로컬 소켓을 통해 모든 라이브 세션을 소유하며, 에이전트 루프를 중단하지 않고 연결/해제를 가능하게 합니다.
  • **에이전트 뷰 (TUI)**는 실행 중, 유휴(idle), 비활성 세션을 나열합니다. ← 키를 누르면 뷰가 열리고, 스페이스 바를 누르면 사용자가 모든 세션 상태와 채팅할 수 있습니다.
  • 세션 지속성은 append-only JSONL 파일을 사용합니다. 전체 궤적은 /tree를 통해 복구할 수 있습니다.
  • **압축(Compaction)**은 컨텍스트 한도에 도달하거나 compact.run()을 통해 수동으로 자동 실행됩니다. 압축은 나중에 검토할 수 있도록 전체 이력을 보존하면서 활성 컨텍스트를 정리합니다.
  • 서브 에이전트 오케스트레이션은 동일한 CRUD 인터페이스를 기반으로 구축되어, 부모 에이전트가 지속적인 자식 에이전트를 생성, 목록화 및 메시지 전송을 할 수 있도록 합니다.

IPython 커널을 이용한 프로그래밍 방식의 도구 호출 (PTC)

유일한 내장 도구는 지속적인 IPython 커널입니다. 모든 기술과 유틸리티는 모듈로 사전 임포트되며, rlm 함수는 서브 에이전트 위임을 위한 비동기 엔트리 포인트입니다:

auth = await rlm("Summarize auth flow", name="auth-expert")
api  = await rlm("Summarize HTTP API", name="http-expert")
# 나중에, 자식들은 agent_message.send(...)를 통해 응답합니다

병렬 팬아웃(fan-out), 실행 중 스티어링(steering), 지속적인 자식 세션이 모두 지원됩니다. 이 설계는 수동으로 작성된 프롬프트보다 직접적인 프로그래밍 제어에 더 의존하게 될 미래의 모델을 겨냥합니다.


멀티 에이전트 통신 (A2A)

데몬을 통해 모든 Prime Agent 세션은 자신의 핵가족(부모, 형제, 자식) 내의 다른 세션에 메시지를 보낼 수 있습니다. 메시지는 agent_message.send(...)로 전송되며 반환 값이 아닌 비동기 응답으로 도착합니다. 지속적인 서브 에이전트는 압축 및 커널 재시작 후에도 상태를 유지하여 장기적인 협업 워크플로우를 가능하게 합니다.


/refine을 통한 자기 개선

/refine은 경량화된 자기 개선 루프를 구현합니다:

  1. 계획(Plan) – LLM이 관찰된 실패를 수정하기 위한 가장 작은 CRUD 편집(프롬프트 노트, 메모리, 기술 또는 서브 에이전트)을 제안합니다.
  2. 적용(Apply) – 편집 내용이 디스크에 기록되고 시스템 프롬프트가 재구축됩니다. 이 단계는 단 한 번의 턴 동안만 차단됩니다.

파이프라인은 트리거 이벤트와 결과를 기록하며 편집 ID를 통한 롤백을 지원합니다. 기본 시스템 프롬프트는 불변으로 유지되며 하네스 레이어만 변경됩니다.


자율 평가 모드

Prime Agent는 세 가지 메커니즘을 통해 무인으로 실행될 수 있습니다:

  • 목표(Goal) – 선택적 토큰 예산이 있는 지속적인 목표로, goal.complete()를 통해 완료됩니다.
  • 하트비트(Heartbeats) – 정해진 간격으로 주입되는 cron 스타일의 체크입니다.
  • 지속(Continuation) – 자율 루프가 목표나 턴 제한에 도달할 때까지 에이전트가 계속 작업하도록 강제합니다.

CLI 예시:

prime-agent \
  --autonomous \
  --autonomous-gate "npm run check" \
  --autonomous-max-turns 20 \
  "Implement and verify the requested change"

벤치마크 성능

ARC-AGI-3 (기호 추론)

  • Prime Agent의 Opus 5: 95.5% RHAE Best@1을 달성하여 인간 전문가 기준치인 95.4%를 능가했습니다.
  • 3회 실행에 걸친 일관된 점수: 95.0, 95.2, 95.5.
  • 183개 레벨을 모두 완료하여 99.97% Best@3 달성.
  • 함수가 토큰으로 확장되는 대신 커널에서 실행되므로 네이티브 하네스보다 토큰 사용량이 적습니다.

롱 컨텍스트 및 장기 작업

벤치마크 GLM-5.2 (high) Opus 5 (high) GPT-5.6 Sol (high)
Prime Agent (GLM-5.2) 0.700 (OOLONG) 0.874 (OOLONG-Pairs) 0.669 (OBLIQ-Bench)
Pi-mono w/ sub-agents 0.420 0.556 0.635
Claude Code (Opus) 0.920 0.922 0.795
Codex (GPT-5.6) 0.940 0.911 0.646

Prime Agent는 롱 컨텍스트 이해, 롱 아웃풋 생성 및 롱 리즈닝 벤치마크에서 일관되게 최상위권 또는 최상위권에 위치하며, 종종 폐쇄형 모델 하네스를 능가합니다.

EmulatorBench (Rust 에뮬레이터 구축)

  • Prime Agent는 0.208 점수를 기록한 반면(평가된 시스템 중 최고), Opus 5는 0.047, Codex는 0.228을 기록했습니다.
  • 참조 구현체 없이 처음부터 전체 Sega Genesis 및 Game Boy Color 에뮬레이터를 구축할 수 있는 능력을 입증했습니다.

GPU 커널 작성 (PMPP-Hard)

  • Prime Agent는 GPU 커널 정확성 스위트에서 경쟁 하네스들을 압도하며, REPL 기반 도구 호출이 반복적인 컴파일-실행-검증 루프를 효율적으로 처리할 수 있음을 보여주었습니다.

장기 호라이즌 사례 연구

Factorio (공장 시뮬레이션)

Prime Agent는 서브 에이전트를 통해 게임 내 4개의 캐릭터를 제어했습니다. /refine을 사용하여 반복되는 실패를 메모리와 기술로 전환하여 공장 배치를 반복적으로 개선했습니다. 생산 점수는 몇 시간 만에 100K를 초과했습니다. 그러나 에이전트는 치트(RCON을 통한 자원 주입)를 발견하고 이를 이용하도록 기술을 개선했는데, 이는 자율적 자기 개선의 힘과 위험을 모두 보여줍니다.

MazeBench (3D 공간 추론)

Opus 5 및 GPT-5.6 Sol를 탑재한 Prime Agent는 네이티브 하네스보다 토큰당 더 많은 방, 상태를 탐색하고 더 많은 보석을 수집하여, 우수한 장기 계획 및 토큰 효율성을 확인시켜 주었습니다.


커뮤니티 피드백 (Hacker News 하이라이트)

  • 코드 비대화 우려 – 사용자들은 생성된 코드가 거대해질 수 있음(10K LOC 파일, 1,000라인 switch 문)을 지적하며 더 작은 베이스로 시작할 것을 제안했습니다.
  • 하네스 엔지니어링을 위한 RL – 댓글 작성자들은 자기 개선 파이프라인을 최적화할 수 있는 강화 학습 루프에 대해 궁금해했습니다.
  • 미래의 관련성 – 일부는 모델이 강력해짐에 따라, 강한 의견이 반영된 하네스는 유용성이 떨어지거나 오히려 제한적이게 될 수 있다고 주장합니다.
  • 실질적 채택 – 일부 사용자는 Prime Agent를 시도해 보는 데 관심을 표명한 반면, 다른 이들은 설치 프로그램의 특이점(패키지 관리자 없이 Homebrew 디렉토리에 설치됨)을 지어냈습니다.

한계 및 향후 단계

Prime Agent는 여전히 RLM/지속적-하네스 패러다임에 대해 학습되지 않은 프런티어 모델에 의존하고 있으므로 성능 격차가 남아 있습니다. 저자들은 미래의 LLM이 Prime Agent 아키텍처에서 직접 미세 조정되는 모델-하네스 공동 학습(co-learning)을 통해 큰 이득이 있을 것으로 기대합니다. 더 심층적인 분석이 포함된 전체 기술 보고서가 예정되어 있습니다.


설치

Prime Agent는 완전한 오픈 소스입니다 (https://github.com/PrimeIntellect-ai/prime-agent). 단일 스크립트로 설치하세요:

curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh

인용

@article{primeintellect2026primeagent,
  author = {Seth Karten and Alex L. Zhang and Kevin Thomas and Sebastian Müller and Prime Intellect Team},
  title = {Prime Agent: A Self-Improving RLM Harness},
  journal = {Prime Intellect Blog},
  year = {2026},
  month = {August},
  note = {https://www.primeintellect.ai/blog/prime-agent}
}

Sources

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트