leo-lilinxiao/codex-autoresearch

Codex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.

codex‑autoresearch – OpenAI Codex 的自主、可度量实验

是什么 – 一个让模型在 Git 跟踪的代码库上运行闭合回路「autoresearch」过程的 Codex 技能。您提供一个数值目标(例如:error_count 降至 0)。该技能随后:

  1. 检查 仓库,确认目标、可编辑的文件、度量命令和任何回归保护。
  2. 向 Codex 提出请求,生成一个单一、聚焦的变更。
  3. 提交 变更,运行验证命令,读取度量值。
  4. 保留 变更(如果度量值改善且保护通过)或 回滚 变更(否则)。
  5. 重复直到目标达成或硬停止发生。

所有状态存储在 autoresearch-results/ 文件夹中(JSONL 事件日志、HTML 报告、日志等),从不提交到仓库中。


主要特性

特性 为何重要
Git 支持的安全性 – 每次试验都是一个提交;失败时通过 git revert 回滚。 保证可重现、可审计的历史记录。
度量驱动的循环 – 任何输出单个数字(或包含数值键的 JSON)的命令均可作为目标。 适用于测试失败、覆盖率、延迟、二进制大小、安全发现等。
前台与后台模式 – 可在当前 Codex 任务中交互式运行,或分离一个工作进程夜间持续运行。 适用于快速调整或长时间优化。
明确确认 – 在首次编辑前,Codex 会显示目标、范围、度量、保护和模式;您必须批准。 防止意外更改。
丰富报告 – 不可变的 run.json、追加只读的 events.jsonl,以及可视化度量轨迹的自包含 report.html 易于审计和共享结果。
安全模型 – 超出范围的编辑、格式错误的度量、超时或保护失败都会以清晰错误中止运行。 使自主运行值得信赖。

典型用例

  • 修复不稳定的测试 – 目标为测试套件运行器的 error_count = 0。
  • 减小二进制大小 – 度量为 du -b 报告的大小。
  • 提升性能 – 度量为基准测试脚本测量的延迟。
  • 自动化安全加固 – 度量为静态分析警告的数量。
  • 迭代重构 – 任何可表示为单一数值的可度量质量。

快速安装与首次运行

# 安装技能(需要支持技能安装器的较新 Codex 版本)
skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch

# 打开一个具有完整写入权限的干净仓库
codex --dangerously-bypass-approvals-and-sandbox

# 开始实验(示例:驱动 error_count → 0)
$codex-autoresearch
# 您将被提示显示基线、目标、范围、验证命令等
# 确认后,让 Codex 在前台或后台运行。

手动安装请参见 docs/INSTALL.md


循环工作原理(简化)

检查证据 → 提出一次变更 → 提交并运行度量 →
   如果改善且保护通过 → 保留提交
   否则 → 回滚提交
将事件追加到 events.jsonl → 重复直到目标达成

控制脚本 负责 Git 操作和状态文件;Codex 负责假设生成和代码编辑。


安全与信任

  • 每次试验都是 真实 的 Git 提交,从不进行内存内编辑。
  • 未改善或保护失败的试验会自动回滚。
  • 格式错误的度量、命令失败、超时或仓库漂移(如分支变更)时,运行中止。
  • 无文件被暂存;所有工件均保留在 autoresearch-results/ 中。
  • 仅当保留的度量值满足确认的目标时,运行才报告为 完成

文档与帮助

  • 安装docs/INSTALL.md
  • 用户指南docs/GUIDE.md(配置、生命周期、故障排除)
  • 示例docs/EXAMPLES.md(示例提示、度量模式)
  • 贡献CONTRIBUTING.md
  • FAQ – 内置于 README(涵盖 Git 要求、停止/恢复、完全访问需求等)

许可证

MIT – 详见 LICENSE


核心要点codex‑autoresearch 是一个基于 Git 的具体自动化层,使 OpenAI Codex 能够运行假设驱动的代码变更,直到达到数值目标,同时具备完整的可审计性和安全保证。这是一个真正的软件项目,旨在对代码库进行自主实验,正位于 AI 辅助开发的前沿。

相关

  • 项目
  • 项目
  • 项目
  • 项目