thruwire/foreman

Software factory foreman based on TypeSafe's Jev model

해결하는 문제

Foreman은 느리고 상태를 유지하는 코딩 에이전트를 감시하는 문제를 해결하기 위한 아키텍처 실험입니다. 이는 코딩 에이전트가 작업을 중단하지 않고도, 진전 여부, 멈춤 여부, 요구사항 완료 여부를 독립적으로 평가할 수 있도록 빠른 의사결정 모델(Jev)을 감시자로 도입합니다.

작동 방식

Foreman은 두 개의 동시 루프를 가진 네이티브 Python asyncio 런타임으로 작동합니다: 코딩 에이전트 루프(예: Codex가 실제 엔지니어링 작업을 수행)와 Foreman 루프(감시자)입니다.

워커가 활성화된 동안 Foreman은 '공장 증거'—git 상태, 제한된 차이점, 워커 이력, 출력의 마지막 부분 등—를 수집하고, 이 컴팩트한 상태를 Jev 모델에 전송합니다. Jev는 implementation_complete, worker_stuck, needs_human와 같은 9개의 다른 차원에 대해 확률 점수를 반환합니다. 결정론적인 Python 정책은 이러한 확률을 '계속하기', '가이드라인으로 워커 유도', '멈춘 프로세스 중지', '독립적 검증자 시작'과 같은 행동으로 변환합니다.

대상 사용자

에이전트 기반 소프트웨어 엔지니어링과 '의미적 감시' 개념에 관심이 있는 개발자 및 AI 연구자. 의미적 감시란 빠르고 전문적인 모델이 소프트웨어 공장 전체를 감시하는 개념입니다.

주요 특징

  • 병렬 감시: 워커의 '이유-도구-관찰' 루프를 방해하지 않고 실시간으로 감시 가능.
  • 확률적 평가: Jev를 사용해 여러 감시 질문을 독립적이고 병렬로 평가.
  • 실시간 유도: App Server 프로토콜을 통해 활성 Codex 턴에 가이드라인 전송 가능.
  • 안전 우선 정책: 인간 개입을 지속 작업보다 우선하는 결정론적 개입 계층 구현.
  • 결정론적 데모: API 키나 Codex CLI가 필요 없는 시뮬레이션 모드를 포함하여 런타임과 정책 테스트 가능.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트