mlhher/late-cli

High-performance AI agent for long-horizon tasks. Built on empirical research. 200k+ tokens of work inside a 64k context window.

解决的问题

Late 是一个旨在防止 LLM 的上下文窗口因编译错误、文件读取和失败的 diff 等执行噪声而变得杂乱,从而引发「推理崩溃」的 AI 编码代理。通过将规划与执行阶段分离,它使模型能够在不丢失准确性的前提下处理超出其原生上下文限制的任务。

工作原理

Late 采用 主协调器 与临时 子代理 之间的架构分离:

  • 主协调器:严格负责规划和验证。物理上禁止其写入文件或执行会修改状态的 bash 命令。
  • 子代理(编码器和研究员):在隔离的上下文中启动,执行原子性任务。任务完成后,子代理的嘈杂临时工作区将被清除,仅将高信号的结构化诊断信息返回给协调器。
  • 逻辑偏置:对于 llama.cpp 用户,它会抑制重复的「思考」令牌(例如「Wait...」、「Hmm」),以减少思维链的膨胀。
  • 工具裁剪:设置硬性边界,防止协调器绕过委托,也防止子代理生成更多代理。

适用人群

使用本地 LLM(通过 llama-server)或云服务执行复杂多步骤编码任务的开发者,尤其适用于大型代码库场景,传统单体代理常因上下文污染而失败。

核心亮点

  • 架构隔离:强制规划与执行之间严格分离,以保护协调器的上下文。
  • 零依赖二进制:使用 Go 编写,无需 Python 或 Node.js 运行时,启动速度极快(<10ms)。
  • 沙箱执行:通过 late-podman 支持无 root 权限的 devcontainers,实现安全、自主的夜间重构。
  • 模型无关:开箱即用,兼容 llama-server(端口 8080)或主流云 API(DeepSeek、Claude、GPT 等)。
  • 可扩展性:内置通用插件系统,支持自定义斜杠命令、MCP 服务器和生命周期钩子。

相关

  • 项目
  • Dispatch
  • 项目
  • 项目
  • 项目