greyhaven-ai/autocontext
a recursive self-improving harness designed to help your agents (and future iterations of those agents) succeed on any task
解决的问题
autocontext 为 AI 代理提供了一个递归自我改进框架。它通过自动化执行任务评估、提取有用的经验并摒弃死胡同,来解决代理不一致和失败的问题,确保代理在未来的迭代中能在给定目标上表现得更好。
工作原理
该系统以循环方式运作:它接收一个自然语言目标,使用指定的代理提供商(例如 Anthropic、OpenAI 或通过 vLLM/Ollama 的本地模型)执行任务,并评估结果。然后它会生成产物——包括剧本、报告和数据集——作为下一次运行的上下文。
关键技术机制包括:
- 结果门控上下文包:不可变的改进候选项在启用前,会先经过评估筛选和确认。
- 因果归因:系统使用基于消融实验的归因分析,来确定哪些特定的上下文变更真正改善了结果,防止低价值的编辑被提升。
- 持久性活动:长时间运行的评估通过重启安全的调度和计费机制进行管理,以避免产生重复的提供商成本。
- 提炼:稳定的行为可以通过
train命令提炼到成本更低的 Python 运行时中。
适用人群
它专为正在构建代理的开发者和 AI 研究人员设计,帮助他们超越手动提示工程,转向系统化、证据驱动的代理优化和可靠性方法。
亮点
- 多提供商支持:兼容 Pi、Anthropic、OpenAI、OpenRouter 以及自托管的本地模型。
- 文件系统优先架构:所有踪迹、生成内容和知识(剧本、提示)都以文件形式存储,便于检查和差异比对。
- MCP 集成:可作为 Model Context Protocol (MCP) 服务器提供服务,以便在 Claude Code 或 Cursor 等客户端中使用。
- 内核演化:支持专门的研究,用于优化如 matmul 和 causal-attention 系列等低级操作。
- TUI 和 CLI:提供命令行界面和终端用户界面,用于管理和监视运行过程。
相关
- 项目
- 项目
- 项目
- 项目