mlhher/late-cli
Stop degrading your model's reasoning. A minimal, zero-config AI coding agent. Enforced ephemeral subagents keep context pure. From tiny local models up to Sol, Fable and Kimi K3.
解决的问题
Late 解决了标准 AI 编程代理的“架构瓶颈”问题,即单个共享上下文窗口会被编译错误、Lint 失败和文件写入日志填满。这些“噪声”会占用 KV 缓存,并随着时间的推移降低模型的推理能力。
工作原理
Late 采用将规划与执行分离的“分裂大脑”架构:
- 主编排器 (Main Orchestrator):一个分析意图并制定主计划的高层代理。其上下文窗口保持纯净,仅包含指令和确定的结果。
- 临时子代理 (Ephemeral Subagents):编排器生成专门的子代理(例如用于编码或研究)来执行特定任务。这些子代理会吸收执行过程中的“噪声”(如原始数据膨胀或重试循环)。
- 上下文销毁:一旦子代理完成任务,其整个上下文将被销毁,仅将最终结果返回给编排器。
适用对象
专为希望以最少设置获得高吞吐量 AI 编程辅助的开发者和构建者设计,同时支持本地 LLM(通过 llama-server)和云提供商。
亮点
- 零依赖二进制文件:以静态编译的二进制文件形式分发,无需 Python 或 Node.js 环境。
- 混合模型路由:能够使用强大的推理模型进行规划,并使用更便宜、更快的模型进行执行。
- 精确匹配 Diff:使用具有自愈功能的严格搜索/替换块,防止静默文件损坏。
- MCP 集成:通过标准 I/O 原生支持 Model Context Protocol 服务器。
- 有状态的复原能力:在磁盘上维护会话历史,允许在重启后恢复工作。
- Git Worktree 支持:允许在不同分支上并行运行代理实例,而不会发生上下文混淆。