robonuggets/gauntlet-loop
Turn any goal into a short prompt that makes your agent set a real quality bar, run builder and critic pairs, compare blind, and loop until it wins.
무엇을 해결하는가
AI 에이전트가 모호한 루브릭(rubric) 대신 구체적이고 외부적인 품질 기준을 사용하게 함으로써, '적당히 괜찮은' 수준에서 멈추는 것을 방지합니다. 에이전트가 특정 고품질 참조 모델보다 결과물이 객관적으로 더 나아질 때까지 구축과 비판의 과정을 반복하도록 강제하는 엄격한 프롬프트를 자동으로 생성합니다.
작동 방식
- 목표 설정: 사용자가 목표(예: 랜딩 페이지 또는 CLI 도구)를 제공합니다.
- 기준 선택: 해당 기술은 품질 표준 역할을 할 수 있는 2-3개의 구체적이고, 가져올 수 있으며, 비교 가능한 실제 사례(기준)를 제안합니다.
- 프롬프트 생성: 기준이 선택되면, 기술은 바로 붙여넣어 사용할 수 있는 짧은 프롬프트(약 150단어)를 생성합니다.
- 실행 루프: 에이전트 세션에 프롬프트가 붙여넣어지면, 에이전트는 작업을 작은 단위로 나누고 '빌더(builder)'와 별도의 '가혹한 비판가(harsh critic)' 에이전트를 활용합니다. 비판가는 현재 작업물과 참조 기준 사이의 블라인드 비교를 수행하며, 작업물이 비교에서 승리할 때까지 루프를 반복합니다.
대상 사용자
에이전트 워크플로우가 평범한 결과물이 아닌 전문가 수준의 결과를 생성하도록 보장하고 싶은 AI 에이전트 개발자 및 파워 유저.
주요 특징
- 블라인드 비교: 수치적 채점 시 흔히 발생하는 점수 드리프트(score-drift) 현상을 피하기 위해, 새로운 컨텍스트를 가진 별도의 비판가 에이전트를 사용하여 작업물과 기준 사이의 승자를 결정합니다.
- 구체적인 기준: 모호한 기준 대신 이름이 명시되어 있고, 가져올 수 있으며, 비교 가능한 참조 모델을 선호합니다.
- 에이전트 독립성:
/loop및ultracode와 같은 Claude Code 기능을 지원하지만, 일반적인 지침을을 통해 어떤 에이전트에서도 사용할 수 있도록 조정 가능합니다. - 결과 기반 종료: 루프는 작업물이 블라인드 비교에서 승리하거나 사용자가 수동으로 중단할 때만 종료됩니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트