greyhaven-ai/autocontext

a recursive self-improving harness designed to help your agents (and future iterations of those agents) succeed on any task

解決的問題

autocontext 為 AI 代理提供了一個遞迴自我改進框架。它透過自動化執行任務評估、提取有用的經驗,並摒棄死胡同,來解決代理不一致與失敗的問題,確保代理在未來的迭代中能在給定目標上表現得更好。

運作方式

該系統以迴圈方式運作:它接收一個自然語言目標,使用指定的代理供應商(例如 Anthropic、OpenAI 或透過 vLLM/Ollama 的本地模型)執行任務,並評估結果。接著它會產生成品——包括劇本、報告和資料集——作為下一次執行的上下文。

關鍵技術機制包括:

  • 結果閘控上下文包:不可變的改進候選項目在啟用前,會先經過評估篩選與確認。
  • 因果歸因:系統使用基於消融實驗的歸因分析,來決定哪些特定的上下文變更真正改善了結果,防止低價值的編輯被晉升。
  • 持久性活動:長時間執行的評估透過重啟安全的排程與計費機制進行管理,以避免產生重複的供應商成本。
  • 提煉:穩定的行為可以透過 train 命令提煉到成本更低的 Python 執行階段中。

適用對象

它專為正在建構代理的開發者與 AI 研究人員設計,協助他們超越手動提示工程,轉向系統化、證據驅動的代理最佳化與可靠性方法。

亮點

  • 多供應商支援:相容於 Pi、Anthropic、OpenAI、OpenRouter 以及自架的本地模型。
  • 檔案系統優先架構:所有蹤跡、生成內容和知識(劇本、提示)都以檔案形式儲存,便於檢查與差異比對。
  • MCP 整合:可作為 Model Context Protocol (MCP) 伺服器提供服務,以便在 Claude Code 或 Cursor 等用戶端中使用。
  • 核心演化:支援專門的研究,用於最佳化如 matmul 和 causal-attention 系列等低階操作。
  • TUI 與 CLI:提供命令列介面與終端機使用者介面,用於管理與監看執行過程。

相關

  • 專案
  • 專案
  • 專案
  • 專案