mlhher/late-cli

High-performance AI agent for long-horizon tasks. Built on empirical research. 200k+ tokens of work inside a 64k context window.

解決的問題

Late 是一個旨在防止 LLM 的上下文視窗因編譯錯誤、檔案讀取與失敗的 diff 等執行雜訊而混亂,進而導致「推理崩潰」的 AI 編碼代理。透過將規劃與執行階段分離,它讓模型能在不損失準確性的前提下,處理超出其原生上下文限制的任務。

工作原理

Late 採用 主協調器 與暫時性 子代理 之間的架構分離:

  • 主協調器:嚴格負責規劃與驗證。物理上禁止其寫入檔案或執行會修改狀態的 bash 命令。
  • 子代理(程式設計師與研究員):在隔離的環境中啟動,執行原子性任務。任務完成後,子代理的雜訊雜亂暫存區將被清除,僅將高訊號的結構化診斷資訊回傳給協調器。
  • 邏輯偏置:針對 llama.cpp 使用者,會抑制重複的「思考」權杖(例如「Wait...」、「Hmm」),以減少思考鏈的膨脹。
  • 工具裁剪:設置硬性邊界,防止協調器繞過委派,也防止子代理產生更多代理。

適用對象

使用本地 LLM(透過 llama-server)或雲端服務執行複雜多階段編碼任務的開發者,特別適用於大型程式碼庫場景,傳統單體代理常因上下文污染而失敗。

核心亮點

  • 架構隔離:強制規劃與執行之間嚴格分離,以保護協調器的上下文。
  • 零依賴二進位:使用 Go 編寫,無需 Python 或 Node.js 執行環境,啟動速度極快(<10ms)。
  • 沙箱執行:透過 late-podman 支援無 root 權限的 devcontainers,實現安全、自主的夜間重構。
  • 模型無關:開箱即用,相容 llama-server(埠 8080)或主流雲端 API(DeepSeek、Claude、GPT 等)。
  • 可擴展性:內建通用外掛系統,支援自訂斜線指令、MCP 伺服器與生命週期鈎子。

相關

  • 專案
  • Dispatch
  • 專案
  • 專案
  • 專案