Raven: 재귀적 자기 개선을 위한 하이든의 하이든
Raven이 제공한다고 주장하는 것
Raven은 AI 에이전트의 재귀적 자기 개선(RSI)을 가능하게 하는 "하이든의 하이든"으로 위치지정된다. 이 플랫폼은 복잡한 다단계 워크플로우를 조율할 수 있는 호스트 에이전트 아래에 연구, 코드, 디자인, 온콜 네 가지 내장 에이전트를 통합한다. 플랫폼은 지속적인 세션 간 메모리를 제공하는 EverOS 기반으로 구축되었으며, 에이전트의 계획, 능력, 메모리, 동작 모듈을 라운드 간에 수정할 수 있는 Curator 컴포넌트를 포함한다.
"Raven은 재귀적 자기 개선(RSI)을 위해 만들어진 하이든의 하이든이다." – Raven README
종단간 프로젝트 사례
Raven은 세 가지 서로 다른 프로젝트의 완전한 자동 배달을 보여준다:
- THRESHOLD 게임 – Godot 4에서 4일간 개발된 1인칭 슈팅 게임으로, 42회의 계획-개발-검증 사이클을 포함한다. 결과물에는 플레이 가능한 게임, 포스터, 발표 자료, 웹사이트가 포함된다.
- Raven RSI 벤치마크 – 7라운드에 걸쳐 172개의 나노 챗 사전 훈련 실험을 실행하는 자기 개선 파이프라인으로, 단일 GPU 예산 내 20분 동안 검증 비트/바이트(
val_bpb)를 5.8% 감소시켰다. 또한 댐 붕괴 CFD 시뮬레이션(오차 1e0 → 1.36e‑10)과 8라운드에 걸친 FEA 한계 하중 이분법 탐색을 수행했다. - 제품 출시 키트 – 브라우저 기반 물리 미니게임, 16슬라이드 개요, 양국어 포스터, README 등이 모두 Raven에 의해 생성되었다.
각 사례는 영상 데모, 웹사이트 링크, 다운로드 가능한 슬라이드 덱을 포함하여, 인간 개입 없이 전문 에이전트 팀을 요청부터 최종 결과물까지 이끄는 Raven의 능력을 보여준다.
내장 에이전트의 벤치마크 성능
Raven의 네 가지 핵심 에이전트는 도메인 특화 벤치마크에서 평가된다:
- Raven-Research – DeepResearch Mixed 벤치마크(정확도, 토큰 사용량, 비용)에서 경쟁력 있는 순위를 기록한다.
- Raven-Code – SWE-bench Pro, SWE-bench Verified, WorkBuddy-Code Reward, SWE-Refactor에서 최고 수준의 점수를 달성했으며, 데이터 분석 작업에서 DataAgentBench(Pass@1 = 0.8762)에서도 선두를 달린다.
- Raven-Design – 슬라이드 생성에서 PresentBench에서 선도하고, ArtifactsBench 시각 디자인 지표에서 높은 점수를 받는다.
- Raven-Oncall – AI4AI 및 AI4S 내부 벤치마크에서 Claude Code보다 우수한 성능을 보이며, 무인 워크플로우 자동화에서 더 높은 품질과 낮은 비용을 제공한다.
이러한 결과는 저장소 내 정적 이미지로 제시되며, README에는 원시 수치나 기초 평가 스크립트에 대한 링크가 제공되지 않는다.
런타임 자기 진화 아키텍처
Raven의 에이전트 루프는 네 개의 분리된 전략 모듈로 나뉜다:
| 모듈 | 역할 |
|---|---|
| Memory | 각 턴마다 에이전트가 보는 정보를 결정한다. |
| Planning | 현재 반복의 계획을 생성한다. |
| Capability | 에이전트가 호출할 수 있는 도구 또는 외부 서비스를 선택한다. |
| Action | 선택된 작업을 실행하고 그 결과를 판단한다. |
Curator는 특정 에이전트의 이러한 모듈 중 하나를 다시 작성할 수 있으며, 이는 에이전트의 프롬프트, 도구 세트, 기술, 판단 코드를 효과적으로 변경하는 것이다. 변경 사항은 유효성 검사를 통과한 후에만 설치되며, 실패한 검사는 에이전트를 이전 버전으로 되돌린다. Curator는 패키지 바이너리가 아니라 실험적 컴포넌트로서 저장소에 포함되어 있다.
먼저 Persona가 생성된다: 사용자가 원하는 보조자의 특성을 설명하면, Curator는 내장 세트에서 추출한 리더 역할과 전문 하위 에이전트를 조합한다. 결과로 나오는 하이든은 작업 분담, 도구 접근, 검증 기준을 정의한다.
*"한 번만 필요한 것을 설명하세요. Raven은 보조자를 조립하고, 당신이 작업하는 동안 계속 개선하며, 이후 한 문장만으로 다시 사용할 수 있게 합니다."
제3자 에이전트의 통합
Raven은 세 가지 메커니즘을 통해 외부 에이전트를 조율할 수 있다:
- ACP(에이전트 통신 프로토콜)
- CLI 래퍼
- OpenAI 호환 API
Claude Code, GitHub Copilot, Qwen Code 등 13개의 제3자 에이전트에 대한 프리셋이 포함되어 있어, 하나의 워크플로우 내에서 내장 기능과 외부 기능을 혼합할 수 있다.
설치 및 사용 방법
Raven은 여러 설치 경로를 제공한다:
- Linux/macOS/WSL2용 일체형 스크립트:
curl -fsSL https://raven.evermind.ai/install.sh | bash - 네이티브 Windows용 PowerShell 스크립트.
- 컨테이너 배포를 위한 Docker Compose.
- 개발용 편집 가능한 소스 체크아웃 (
./install.sh).
설치 후, raven web 명령어를 실행하면 브라우저 기반 UI가 열리며, 사용자는 작업 생성, 하위 에이전트 모니터링, 메모리 검사, 기술 둘러보기 등을 할 수 있다.
Hacker News 커뮤니티 반응
HN 토론은 다음과 같은 주제들을 강조했다:
- 스타 수에 대한 회의론 – 비교적 알려지지 않은 저장소가 수천 개의 GitHub 스타를 어떻게 모았는지에 대해 의문을 제기했다.
- "한 프롬프트, 한 결과" 주장에 대한 비판 – 실제 제품 개발은 반복적인 프롬프팅과 조정이 필요하다고 주장하며, 완전히 자율적인 하이든의 실용성에 의문을 제기했다.
- RSI의 정의 명확화 – 일부 댓글에서 "RSI"는 "재귀적 자기 개선"을 의미하며, "반복적 긴장 손상"이 아니라고 설명했다.
- 기존 메타 하이든과의 비교 – Omnigent, Paseo, DeepSeek Harness와 같은 유사 프로젝트를 언급하며, 비교 벤치마크를 요청했다.
- 성능에 대한 우려 – 일부는 코딩 벤치마크에서 약간의 성능 향상(예: SWE-bench Verified에서 0.8% 향상)과 토큰 효율성에 의문을 제기했다.
- 긍정적인 인상 – 몇몇 사용자는 README의 시각적 디자인과 인상적인 THRESHOLD 사례를 칭찬했다.
전반적으로, 이 토론은 자기 진화하는 다중 에이전트 플랫폼의 개념에 대한 열정과 완전히 자율적인 AI 프로젝트 배달에 대한 과대 광고에 대한 경계심이 공존함을 보여준다.
핵심 시스템 요약
| 시스템 | 기능 |
|---|---|
| 에이전트 조율 | DAG 기반의 작업 종속성과 병렬 실행을 관리한다. |
| Evolver | 실패를 진단하고 후보 하이든 변경 사항을 테스트하며, 베이스라인을 초과하는 개선 사항을 채택한다. |
| EverOS 메모리 | 세션 간 지속적인 마크다운 기반 메모리를 제공한다. |
| SkillForge | SkillCorpus에서 수집된 114,000개 이상의 기술을 즉시 활용 가능한 전문 지식으로 검색한다. |
| 주도성 | 이벤트를 모니터링하고 사용자의 필요를 예측하기 위해 작업을 스케줄링한다. |
라이선스 및 인용
Raven은 Apache 2.0 라이선스 하에 배포된다. 학술 작업에서 Raven을 사용할 경우, 기술 보고서(v1, 2026년 9월)를 인용해 줄 것을 요청한다.
이 기사는 위에 링크된 Raven GitHub 저장소와 Hacker News 토론 스레드에서 공개된 정보를 종합한 것입니다. 추가 데이터나 비공개 정보는 포함되지 않았습니다.
Sources
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트