leo-lilinxiao/codex-autoresearch
Codex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.
codex‑autoresearch – OpenAI Codex 用的自主、可度量實驗
是什麼 – 一個讓模型在 Git 追蹤的程式碼庫上執行閉迴路「autoresearch」流程的 Codex 技能。您提供一個數值目標(例如:將 error_count 降至 0)。該技能隨後:
- 檢視 倉儲,確認目標、可編輯的檔案、度量命令與任何回歸保護。
- 向 Codex 提出請求,產生單一且聚焦的變更。
- 提交 變更,執行驗證命令,讀取度量值。
- 保留 變更(若度量值改善且保護通過)或 回滾 變更(否則)。
- 重複直到目標達成或硬停止發生。
所有狀態儲存在 autoresearch-results/ 資料夾中(JSONL 事件日誌、HTML 報告、日誌等),從不提交至倉儲中。
主要特性
| 特性 | 為何重要 |
|---|---|
Git 支援的安全性 – 每次試驗都是提交;失敗時透過 git revert 回滾。 |
保證可重現、可審計的歷史記錄。 |
| 度量驅動的循環 – 任何輸出單一數字(或包含數值鍵的 JSON)的命令均可作為目標。 | 適用於測試失敗、覆蓋率、延遲、二進位大小、安全發現等。 |
| 前臺與背景模式 – 可在目前 Codex 任務中互動式執行,或分離一個工作進程夜間持續執行。 | 適用於快速調整或長時間最佳化。 |
| 明確確認 – 在首次編輯前,Codex 會顯示目標、範圍、度量、保護和模式;您必須批准。 | 防止意外變更。 |
豐富報告 – 不可變的 run.json、追加只讀的 events.jsonl,以及可視化度量軌跡的自包含 report.html。 |
易於審計和共享結果。 |
| 安全模型 – 超出範圍的編輯、格式錯誤的度量、超時或保護失敗都會以清晰錯誤中止執行。 | 使自主執行值得信賴。 |
典型用例
- 修復不穩定的測試 – 目標為測試套件執行器的
error_count= 0。 - 減小二進位大小 – 度量為
du -b報告的大小。 - 提升效能 – 度量為基準測試腳本測量的延遲。
- 自動化安全強化 – 度量為靜態分析警告的數量。
- 迭代重構 – 任何可表示為單一數值的可度量品質。
快速安裝與首次執行
# 安裝技能(需支援技能安裝器的較新 Codex 版本)
skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch
# 開啟一個具有完整寫入權限的乾淨倉儲
codex --dangerously-bypass-approvals-and-sandbox
# 開始實驗(範例:驅動 error_count → 0)
$codex-autoresearch
# 您將被提示顯示基線、目標、範圍、驗證命令等
# 確認後,讓 Codex 在前臺或背景執行。
手動安裝請參見 docs/INSTALL.md。
循環工作原理(簡化)
檢視證據 → 提出一次變更 → 提交並執行度量 →
若改善且保護通過 → 保留提交
否則 → 回滾提交
將事件追加至 events.jsonl → 重複直到目標達成
控制腳本 負責 Git 操作與狀態檔案;Codex 負責假設生成與程式碼編輯。
安全與信任
- 每次試驗都是 真實 的 Git 提交,從不進行記憶體內編輯。
- 未改善或保護失敗的試驗會自動回滾。
- 格式錯誤的度量、命令失敗、超時或倉儲漂移(如分支變更)時,執行中止。
- 無檔案被暫存;所有工件均保留在
autoresearch-results/中。 - 僅當保留的度量值滿足確認的目標時,執行才報告為 完成。
文件與協助
- 安裝 –
docs/INSTALL.md - 使用者指南 –
docs/GUIDE.md(設定、生命週期、故障排除) - 範例 –
docs/EXAMPLES.md(範例提示、度量模式) - 貢獻 –
CONTRIBUTING.md - 常見問題 – 內建於 README(涵蓋 Git 要求、停止/恢復、完全存取需求等)
授權
MIT – 請參閱 LICENSE。
核心重點:codex‑autoresearch 是一個基於 Git 的具體自動化層,使 OpenAI Codex 能夠執行假設驅動的程式碼變更,直到達成數值目標,同時具備完整的可審計性與安全保證。這是一個真正的軟體專案,旨在對程式碼庫進行自主實驗,正位於 AI 輔助開發的最前線。
相關
- 專案
- 專案
- 專案
- 專案