mlhher/late-cli

High-performance AI agent for long-horizon tasks. Built on empirical research. 200k+ tokens of work inside a 64k context window.

何を解決するか

Late は、LLM のコンテキストウィンドウがコンパイラエラー、ファイル読み取り、失敗したdiffなどの実行ノイズで混雑する際に発生する「推論の崩壊」を防ぐように設計されたAIコーディングエージェントです。計画と実行のフェーズを分離することで、モデルがネイティブなコンテキスト制限を超えるタスクを正確に処理できるようにします。

動作方法

Late は リードオーケストレーター と一時的な サブエージェント の間でアーキテクチャ的に分離しています:

  • リードオーケストレーター:計画と検証のみを厳密に処理します。物理的にファイルの書き込みや変更を伴うbashコマンドの実行を禁止されています。
  • サブエージェント(Coder と Researcher):隔離されたコンテキストに起動され、原子的なタスクを実行します。タスクが完了すると、サブエージェントのノイズの多いスクラッチパッドは消去され、オーケストレーターに返されるのは高信号の構造化診断情報のみです。
  • ロジットバイアスllama.cpp ユーザー向けに、重複する「思考」トークン(例:"Wait...", "Hmm")を抑制し、Chain-of-Thoughtの膨張を低減します。
  • ツールの削減:オーケストレーターが委任を回避できないようにハードな境界が設けられ、サブエージェントもさらにエージェントを起動できないように制限されています。

対象ユーザー

llama-server を通じてローカルLLM、またはクラウドプロバイダーを使用して複雑なマルチステップのコーディングタスクを実行する開発者。特に、モノリシックエージェントがコンテキスト汚染のために失敗しやすい大規模なコードベースで作業する人向けです。

特徴

  • アーキテクチャ的隔離:計画と実行の間に厳密な分離を強制し、オーケストレーターのコンテキストを保持します。
  • 依存なしバイナリ:Python や Node.js ランタイムを必要とせず、Goで書かれており、起動がほぼ瞬時(<10ms)です。
  • サンドボックス実行late-podman を通じてルートレスdevcontainersをサポートし、安全で自律的な夜間リファクタリングを可能にします。
  • モデル非依存llama-server(ポート8080)または主要なクラウドAPI(DeepSeek、Claude、GPTなど)と即座に連携可能です。
  • 拡張可能:カスタムスラッシュコマンド、MCPサーバー、ライフサイクルフックに対応するユニバーサルプラグインシステムを備えています。

関連

  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト
  • プロジェクト