mlhher/late-cli
High-performance AI agent for long-horizon tasks. Built on empirical research. 200k+ tokens of work inside a 64k context window.
해결하는 문제
Late는 LLM의 컨텍스트 창이 컴파일러 오류, 파일 읽기, 실패한 diff와 같은 실행 노이즈로 인해 혼잡해질 때 발생하는 "추론 붕괴"를 방지하기 위해 설계된 AI 코드 에이전트입니다. 계획과 실행 단계를 분리함으로써, 모델이 자체적인 컨텍스트 제한을 초과하는 작업을 정확하게 처리할 수 있도록 합니다.
작동 방식
Late는 리드 오케스트레이터와 일시적인 서브에이전트 사이에 아키텍처적 분리를 사용합니다:
- 리드 오케스트레이터: 계획과 검증만을 엄격히 처리합니다. 물리적으로 파일 쓰기나 변형을 포함하는 bash 명령어 실행을 방지됩니다.
- 서브에이전트 (Coder 및 Researcher): 고립된 컨텍스트에 생성되어 원자적인 작업을 수행합니다. 작업이 완료되면 서브에이전트의 노이즈가 많은 스クラ치패드는 삭제되며, 오케스트레이터에게는 고신호의 구조화된 진단 정보만 반환됩니다.
- 로지트 바이어스:
llama.cpp사용자를 위해 중복된 "생각" 토큰(예: "Wait...", "Hmm")을 억제하여 Chain-of-Thought의 부풀어오름을 줄입니다. - 도구 정리: 오케스트레이터가 위임을 회피할 수 없도록 하드 경계를 설정하며, 서브에이전트는 추가 에이전트를 생성할 수 없습니다.
대상 사용자
llama-server를 통해 로컬 LLM 또는 클라우드 제공업체를 사용하여 복잡한 다단계 코드 작업을 수행하는 개발자들. 특히 대규모 코드베이스에서 단일 에이전트가 컨텍스트 오염으로 인해 실패하는 경우가 많은 사용자에게 적합합니다.
주요 특징
- 아키텍처적 격리: 계획과 실행 사이에 엄격한 분리를 강제하여 오케스트레이터의 컨텍스트를 보존합니다.
- 의존성 없는 바이너리: Python 또는 Node.js 런타임이 필요 없이 Go로 작성되어 거의 즉시 시작(10ms 미만)됩니다.
- 사전 격리된 실행:
late-podman을 통해 루트리스 devcontainers를 지원하여 안전하고 자율적인 야간 리팩터링을 가능하게 합니다. - 모델 독립성:
llama-server(포트 8080) 또는 주요 클라우드 API(DeepSeek, Claude, GPT 등)와 즉시 호환됩니다. - 확장성: 사용자 정의 슬래시 명령어, MCP 서버, 라이프사이클 훅을 지원하는 유니버설 플러그인 시스템을 포함합니다.
관련
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트
- 프로젝트