leo-lilinxiao/codex-autoresearch

Codex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.

codex‑autoresearch – OpenAI Codex 用的自主、可度量實驗

是什麼 – 一個讓模型在 Git 追蹤的程式碼庫上執行閉迴路「autoresearch」流程的 Codex 技能。您提供一個數值目標(例如:error_count 降至 0)。該技能隨後:

  1. 檢視 倉儲,確認目標、可編輯的檔案、度量命令與任何回歸保護。
  2. 向 Codex 提出請求,產生單一且聚焦的變更。
  3. 提交 變更,執行驗證命令,讀取度量值。
  4. 保留 變更(若度量值改善且保護通過)或 回滾 變更(否則)。
  5. 重複直到目標達成或硬停止發生。

所有狀態儲存在 autoresearch-results/ 資料夾中(JSONL 事件日誌、HTML 報告、日誌等),從不提交至倉儲中。


主要特性

特性 為何重要
Git 支援的安全性 – 每次試驗都是提交;失敗時透過 git revert 回滾。 保證可重現、可審計的歷史記錄。
度量驅動的循環 – 任何輸出單一數字(或包含數值鍵的 JSON)的命令均可作為目標。 適用於測試失敗、覆蓋率、延遲、二進位大小、安全發現等。
前臺與背景模式 – 可在目前 Codex 任務中互動式執行,或分離一個工作進程夜間持續執行。 適用於快速調整或長時間最佳化。
明確確認 – 在首次編輯前,Codex 會顯示目標、範圍、度量、保護和模式;您必須批准。 防止意外變更。
豐富報告 – 不可變的 run.json、追加只讀的 events.jsonl,以及可視化度量軌跡的自包含 report.html 易於審計和共享結果。
安全模型 – 超出範圍的編輯、格式錯誤的度量、超時或保護失敗都會以清晰錯誤中止執行。 使自主執行值得信賴。

典型用例

  • 修復不穩定的測試 – 目標為測試套件執行器的 error_count = 0。
  • 減小二進位大小 – 度量為 du -b 報告的大小。
  • 提升效能 – 度量為基準測試腳本測量的延遲。
  • 自動化安全強化 – 度量為靜態分析警告的數量。
  • 迭代重構 – 任何可表示為單一數值的可度量品質。

快速安裝與首次執行

# 安裝技能(需支援技能安裝器的較新 Codex 版本)
skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch

# 開啟一個具有完整寫入權限的乾淨倉儲
codex --dangerously-bypass-approvals-and-sandbox

# 開始實驗(範例:驅動 error_count → 0)
$codex-autoresearch
# 您將被提示顯示基線、目標、範圍、驗證命令等
# 確認後,讓 Codex 在前臺或背景執行。

手動安裝請參見 docs/INSTALL.md


循環工作原理(簡化)

檢視證據 → 提出一次變更 → 提交並執行度量 →
   若改善且保護通過 → 保留提交
   否則 → 回滾提交
將事件追加至 events.jsonl → 重複直到目標達成

控制腳本 負責 Git 操作與狀態檔案;Codex 負責假設生成與程式碼編輯。


安全與信任

  • 每次試驗都是 真實 的 Git 提交,從不進行記憶體內編輯。
  • 未改善或保護失敗的試驗會自動回滾。
  • 格式錯誤的度量、命令失敗、超時或倉儲漂移(如分支變更)時,執行中止。
  • 無檔案被暫存;所有工件均保留在 autoresearch-results/ 中。
  • 僅當保留的度量值滿足確認的目標時,執行才報告為 完成

文件與協助

  • 安裝docs/INSTALL.md
  • 使用者指南docs/GUIDE.md(設定、生命週期、故障排除)
  • 範例docs/EXAMPLES.md(範例提示、度量模式)
  • 貢獻CONTRIBUTING.md
  • 常見問題 – 內建於 README(涵蓋 Git 要求、停止/恢復、完全存取需求等)

授權

MIT – 請參閱 LICENSE


核心重點codex‑autoresearch 是一個基於 Git 的具體自動化層,使 OpenAI Codex 能夠執行假設驅動的程式碼變更,直到達成數值目標,同時具備完整的可審計性與安全保證。這是一個真正的軟體專案,旨在對程式碼庫進行自主實驗,正位於 AI 輔助開發的最前線。

相關

  • 專案
  • 專案
  • 專案
  • 專案