leo-lilinxiao/codex-autoresearch
Codex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.
codex‑autoresearch – OpenAI Codex 的自主、可度量实验
是什么 – 一个让模型在 Git 跟踪的代码库上运行闭合回路「autoresearch」过程的 Codex 技能。您提供一个数值目标(例如:将 error_count 降至 0)。该技能随后:
- 检查 仓库,确认目标、可编辑的文件、度量命令和任何回归保护。
- 向 Codex 提出请求,生成一个单一、聚焦的变更。
- 提交 变更,运行验证命令,读取度量值。
- 保留 变更(如果度量值改善且保护通过)或 回滚 变更(否则)。
- 重复直到目标达成或硬停止发生。
所有状态存储在 autoresearch-results/ 文件夹中(JSONL 事件日志、HTML 报告、日志等),从不提交到仓库中。
主要特性
| 特性 | 为何重要 |
|---|---|
Git 支持的安全性 – 每次试验都是一个提交;失败时通过 git revert 回滚。 |
保证可重现、可审计的历史记录。 |
| 度量驱动的循环 – 任何输出单个数字(或包含数值键的 JSON)的命令均可作为目标。 | 适用于测试失败、覆盖率、延迟、二进制大小、安全发现等。 |
| 前台与后台模式 – 可在当前 Codex 任务中交互式运行,或分离一个工作进程夜间持续运行。 | 适用于快速调整或长时间优化。 |
| 明确确认 – 在首次编辑前,Codex 会显示目标、范围、度量、保护和模式;您必须批准。 | 防止意外更改。 |
丰富报告 – 不可变的 run.json、追加只读的 events.jsonl,以及可视化度量轨迹的自包含 report.html。 |
易于审计和共享结果。 |
| 安全模型 – 超出范围的编辑、格式错误的度量、超时或保护失败都会以清晰错误中止运行。 | 使自主运行值得信赖。 |
典型用例
- 修复不稳定的测试 – 目标为测试套件运行器的
error_count= 0。 - 减小二进制大小 – 度量为
du -b报告的大小。 - 提升性能 – 度量为基准测试脚本测量的延迟。
- 自动化安全加固 – 度量为静态分析警告的数量。
- 迭代重构 – 任何可表示为单一数值的可度量质量。
快速安装与首次运行
# 安装技能(需要支持技能安装器的较新 Codex 版本)
skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch
# 打开一个具有完整写入权限的干净仓库
codex --dangerously-bypass-approvals-and-sandbox
# 开始实验(示例:驱动 error_count → 0)
$codex-autoresearch
# 您将被提示显示基线、目标、范围、验证命令等
# 确认后,让 Codex 在前台或后台运行。
手动安装请参见 docs/INSTALL.md。
循环工作原理(简化)
检查证据 → 提出一次变更 → 提交并运行度量 →
如果改善且保护通过 → 保留提交
否则 → 回滚提交
将事件追加到 events.jsonl → 重复直到目标达成
控制脚本 负责 Git 操作和状态文件;Codex 负责假设生成和代码编辑。
安全与信任
- 每次试验都是 真实 的 Git 提交,从不进行内存内编辑。
- 未改善或保护失败的试验会自动回滚。
- 格式错误的度量、命令失败、超时或仓库漂移(如分支变更)时,运行中止。
- 无文件被暂存;所有工件均保留在
autoresearch-results/中。 - 仅当保留的度量值满足确认的目标时,运行才报告为 完成。
文档与帮助
- 安装 –
docs/INSTALL.md - 用户指南 –
docs/GUIDE.md(配置、生命周期、故障排除) - 示例 –
docs/EXAMPLES.md(示例提示、度量模式) - 贡献 –
CONTRIBUTING.md - FAQ – 内置于 README(涵盖 Git 要求、停止/恢复、完全访问需求等)
许可证
MIT – 详见 LICENSE。
核心要点:codex‑autoresearch 是一个基于 Git 的具体自动化层,使 OpenAI Codex 能够运行假设驱动的代码变更,直到达到数值目标,同时具备完整的可审计性和安全保证。这是一个真正的软件项目,旨在对代码库进行自主实验,正位于 AI 辅助开发的前沿。
相关
- 项目
- 项目
- 项目
- 项目