Anthropic 장기 실행 애플리케이션 개발을 위한 하서드 설계
TL;DR
Anthropic는 클라우드가 다시간에 걸쳐 풍부한 프론트엔드 디자인과 전체 스택 애플리케이션을 자율적으로 생성할 수 있도록 하는 3에이전트 하서드(기획자, 생성자, 평가자)를 공개했습니다. 이는 컨텍스트 창 한계와 자기 평가 편향을 극복합니다.
단순한 장기 실행 에이전트가 실패하는 이유
- 컨텍스트 불안 – 클라우드의 컨텍스트 창이 채워질수록 모델은 일찍 작업을 마무리하거나 일관성을 잃습니다. 단순한 압축은 기록을 유지하지만 모델의 내부 상태를 리셋하지 않기 때문에 클라우드는 여전히 불안하게 행동합니다. 완전한 컨텍스트 리셋과 구조화된 핸드오프 아티팩트를 함께 사용하면 모델이 깨끗한 상태에서 작업할 수 있으며, 조기 종료를 방지합니다.
- 자기 평가 편향 – 에이전트가 자신의 출력을 평가할 때, 특히 디자인과 같은 주관적인 작업에서는 과도하게 칭찬하는 경향이 있습니다. 생성과 평가를 분리하면 전용 평가자가 회의적인 태도로 조정될 수 있어 생성자가 반영할 수 있는 구체적인 피드백을 제공할 수 있습니다.
"에이전트는 자신의 작업을 자신감 있게 칭찬하는 경향이 있습니다—사람이 보기에 평범한 수준임에도 불구하고요." – Anthropic 엔지니어링 포스트
주관적인 디자인 품질을 평가 가능한 기준으로 전환하기
Anthropic는 프론트엔드 디자인을 위한 네 가지 명시적인 평가 기준을 정의했습니다:
- 디자인 품질 – 색상, 타이포그래피, 레이아웃, 이미지, 분위기의 통합성.
- 독창성 – 커스텀 결정의 존재 여부, 또는 일반적인 AI 패턴이나 스톡 콘텐츠의 사용 여부.
- 기술적 완성도 – 간격, 대비 비율, 계층 구조와 같은 기술적 실행 수준.
- 기능성 – 미적 요소와 무관한 사용성.
가중치는 기술적 완성도와 기능성은 클라우드가 이미 잘 수행했기 때문에 디자인 품질과 독창성에 중점을 두었습니다. 평가자는 소수의 예시를 통해 점수를 작성자 선호도와 일치하도록 보정되었습니다.
생성자는 HTML/CSS/JS 페이지를 만들었고, 평가자는 플레이라이트를 사용해 실시간 페이지에 접근하고 스크린샷을 찍으며 상세한 비판을 제시했습니다. 반복(각 실행당 5~15회)은 생성과 평가를 번갈아 수행하며, 생성자는 현재 방향을 개선할지 완전히 전환할지를 결정했습니다.
관찰된 결과
- 반복 과정에서 점수가 개선되었지만, 항상 선형적이지는 않았습니다.
- 평가 기준의 표현 방식이 시각적 스타일에 직접적인 영향을 미쳤습니다 (예: "박물관 수준"이라는 표현은 특정한 미적 방향으로 디자인을 이끌었습니다).
- 네덜란드 미술관 사이트의 경우, 10번째 반복에서 생성자가 전통적인 랜딩 페이지에서 3D CSS 기반의 공간적 경험으로 전환하며 두드러진 창의적 도약을 이루었습니다.
GAN 영감을 받은 패턴을 전체 스택 개발로 확장하기
3에이전트 아키텍처
| 에이전트 | 역할 |
|---|---|
| 기획자 | 1~4문장의 프롬프트를 상세한 제품 사양으로 확장하고, AI 강화 기회를 식별하며, 저수준 세부사항을 과도하게 정의하지 않습니다. |
| 생성자 | React-Vite-FastAPI-SQLite/PostgreSQL 스택을 사용해 사양을 기능별로 구현(스프린트 단위), git 기록을 유지하고, 핸드오프 전에 자체 평가를 수행합니다. |
| 평가자 | 플레이라이트를 통해 실행 중인 앱을 실행하고, UI, API, 데이터베이스 동작을 확인하며, 각 스프린트를 기준(디자인, 기능성, 깊이, 코드 품질)에 따라 평가합니다. |
핵심 메커니즘
- 스프린트 계약 – 각 스프린트 전에 생성자가 제출할 결과물과 검증 단계를 제안하고, 평가자가 검토 및 승인함으로써 고수준 사양과의 일치를 보장합니다.
- 파일 기반 핸드오프 – 에이전트들은 구조화된 파일을 읽고 쓰는 방식으로 소통하며, 지속적인 대화 없이도 상태를 유지합니다.
- 자동 컨텍스트 압축 – 클라우드 에이전트 SDK를 사용해 오퍼스 4.5가 커지는 컨텍스트를 처리할 수 있도록 하며, 모델의 "컨텍스트 불안"이 줄어들어 명시적인 리셋 없이도 가능합니다.
비교 벤치마크: 솔로 vs. 전체 하서드
| 하서드 | 소요 시간 | 비용 |
|---|---|---|
| 솔로 클라우드 실행 (단일 에이전트) | 20분 | $9 |
| 전체 3에이전트 하서드 | 6시간 | $200 |
하서드는 훨씬 더 풍부한 기능을 갖춘 레트로 게임 메이커를 생성했으며, 정교한 UI, AI 지원 스프라이트 생성, 기능성 있는 플레이 모드를 포함했습니다. 반면 솔로 실행은 레이아웃 낭비, 손상된 엔티티 연결, 기능 없는 게임플레이로 인해 문제가 있었습니다.
오퍼스 4.6 이후 하서드 단순화
- 오퍼스 4.6은 장기 컨텍스트 처리, 기획, 자가 디버깅 능력이 향상되어 스프린트 분해를 제거하게 되었습니다.
- 기획자와 평가자는 여전히 유용했습니다. 기획자가 없으면 생성자는 프로젝트를 과소 평가했습니다.
- 평가자는 단일 종료 시점 QA 단계로 전환되었습니다. 오퍼스 4.6의 솔로 기능 범위 내 작업에서는 평가자가 별다른 가치를 제공하지 않았지만, 극단적인 사례에서는 여전히 중요한 버그를 포착했습니다.
업데이트된 비용 분석 (DAW 생성)
| 단계 | 소요 시간 | 비용 |
|---|---|---|
| 기획 | 4.7분 | $0.46 |
| 빌드 라운드 1 | 2시간 7분 | $71.08 |
| QA 라운드 1 | 8.8분 | $3.24 |
| 빌드 라운드 2 | 1시간 2분 | $36.89 |
| QA 라운드 2 | 6.8분 | $3.09 |
| 빌드 라운드 3 | 10.9분 | $5.88 |
| QA 라운드 3 | 9.6분 | $4.06 |
| 합계 | 3시간 50분 | $124.70 |
평가자는 여전히 핵심 DAW 상호작용(예: 드래그 가능한 클립, 악기 패널)이 누락된 것을 식별했으며, 더 강력한 모델이더라도 타겟된 QA는 여전히 높은 효율을 발휘함을 보여줍니다.
교훈과 미래 방향성
- 컨텍스트 리셋 vs. 압축 – 모델의 컨텍스트를 리셋하면 "컨텍스트 불안"을 제거하지만 오케스트레이션 오버헤드가 발생합니다. 모델(예: 오퍼스 4.5)이 강한 불안을 보일 경우 리셋이 필수적이지만, 최신 모델은 압축만으로도 충분할 수 있습니다.
- 독립된 평가자 – 생성자가 자기 비판적이 되게 만드는 것보다, 전용 평가자를 회의적으로 조정하는 것이 더 실현 가능합니다. 평가자의 피드백 루프가 반복적 개선을 이끕니다.
- 평가 가능한 주관적 기준 – 디자인 원칙을 명시적인 점수로 변환하면 모호한 미적 판단을 실행 가능한 피드백으로 전환할 수 있습니다.
- 반복적인 하서드 정리 – 모델이 향상될수록 측정 가능한 성과를 제공하지 않는 구성 요소를 체계적으로 제거해야 합니다. 평가자의 유용성은 이진적이지 않고 작업에 따라 다릅니다.
- 하이브리드 분해 – 고수준 기획과 기능 수준의 스프린트 계약을 결합하면 범위 통제와 유연성의 균형을 이룰 수 있으며, 초기 사양 오류가 연쇄적으로 퍼지는 것을 방지합니다.
Anthropic의 작업은 신중한 하서드 설계가 현재 LLM의 실용적 능력을 확장할 수 있음을 보여주며, 모델이 더 강력해질수록 유용한 하서드 조합의 공간은 축소되지 않고 오히려 확장됨을 시사합니다.
감사의 말
Mike Krieger, Michael Agaby, Justin Young, Jeremy Hadfield, David Hershey, Julius Tarng, Xiaoyi Zhang, Barry Zhang, Orowa Sidker, Michael Tingley, Ibrahim Madha, Martina Long, Canyon Robbins, Jake Eaton, Alyssa Leonard, Stef Sequeira 등이 기여해주셔서 감사합니다.
부록: 예시 기획자 출력 (레트로포지 게임 메이커)
RetroForge - 2D 레트로 게임 메이커
개요
RetroForge는 2D 레트로 스타일 비디오 게임을 디자인하고 제작할 수 있는 웹 기반 창작 스튜디오입니다. 고전적인 8비트 및 16비트 게임의 낭만적인 매력과 현대적인 직관적인 편집 도구를 결합하여, 아마추어 창작자부터 인디 개발자까지 전통적인 코드 없이도 게임 아이디어를 현실로 만들 수 있도록 합니다.
기능
1. 프로젝트 대시보드 및 관리
* 프로젝트 생성, 열기, 복제, 삭제
* 썸네일과 타임스탬프를 포함한 시각적 카드
* 메타데이터: 이름, 설명, 해상도, 타일 크기, 팔레트
2. 타일 기반 레벨 에디터
* 드래그 앤 드롭 타일, 레이어, 스크롤링 뷰포트
3. 픽셀 아트 스프라이트 에디터
* 팔레트 선택기, 줌, 프레임 애니메이션
4. 엔티티 행동 시스템
* 이동, 충돌 처리를 위한 시각적 스크립팅
5. 플레이 가능한 테스트 모드
* 실시간 미리보기, 키보드 컨트롤
6. AI 지원 도구
* 프롬프트 기반 스프라이트 생성, 레벨 레이아웃 제안
Sources
관련
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch