mlhher/late-cli
Stop degrading your model's reasoning. A minimal, zero-config AI coding agent. Enforced ephemeral subagents keep context pure. From tiny local models up to Sol, Fable and Kimi K3.
해결하는 문제
Late는 표준 AI 코딩 에이전트의 "아키텍처 병목 현상"을 해결합니다. 기존 방식에서는 단일 공유 컨텍스트 윈도우가 컴파일 오류, 린트 실패, 파일 쓰기 로그로 인해 혼잡해집니다. 이러한 "노이즈"는 KV 캐시를 채우고 시간이 지남에 따라 모델의 추론 능력을 저하시킵니다.
작동 원리
Late는 계획(planning)과 실행(execution)을 분리하는 스플릿 브레인(split-brain) 아키텍처를 사용합니다:
- 메인 오케스트레이터: 의도를 분석하고 마스터 플랜을 수립하는 상위 수준의 에이전트입니다. 컨텍스트 윈도우는 지침과 확정된 결과만 포함하도록 순수하게 유지됩니다.
- 에페머럴 서브 에이전트: 오케스트레이터는 특정 작업을 수행하기 위해 전문화된 서브 에이전트(예: 코딩 또는 리서치용)를 생성합니다. 이러한 서브 에이전트는 실행 과정의 "노이즈"(원시 데이터 팽창 또는 재시도 루프 등)를 흡수합니다.
- 컨텍스트 파기: 서브 에이전트가 작업을 완료하면 전체 컨텍스트가 파기되며, 최종 결과만 오케스트레이터로 반환됩니다.
대상 사용자
로컬 LLM(llama-server 경유)과 클라우드 제공업체를 모두 지원하며, 최소한의 설정으로 높은 처리량의 AI 코딩 지원을 원하는 개발자와 빌더를 위해 설계되었습니다.
주요 특징
- 제로 종속성 바이너리: Python이나 Node.js 환경이 필요 없는 정적 컴파일 바이너리로 배포됩니다.
- 하이브리드 모델 라우팅: 계획에는 강력한 추론 모델을, 실행에는 더 저렴하고 빠른 모델을 사용할 수 있습니다.
- 정확한 일치 Diff: 셀프 힐링 기능이 있는 엄격한 검색/교체 블록을 사용하여 조용한 파일 손상을 방지합니다。
- MCP 통합: 표준 I/O를 통해 Model Context Protocol 서버를 네이티브로 지원합니다。
- 상태 유지 회복력: 세션 기록을 디스크에 유지하여 재부팅 후에도 작업을 재개할 수 있습니다。
- Git Worktree 지원: 컨텍스트 간섭 없이 서로 다른 브랜치에서 에이전트 인스턴스를 병렬로 실행할 수 있습니다.