leo-lilinxiao/codex-autoresearch

Codex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.

codex‑autoresearch – OpenAI Codex 用の自律的・測定可能な実験

何であるか – Git ベースのコードベース上で閉ループ「autoresearch」プロセスを実行できる Codex スキル。数値目標(例:error_count を 0 に削減)を提示すると、スキルは以下の手順を実行します。

  1. 検査 – リポジトリを確認し、目標、編集可能なファイル、メトリクスコマンド、およびリグレッションガードを確認。
  2. Codex に依頼 – 単一で焦点を絞った変更案を提案させる。
  3. コミット – 変更をコミットし、検証コマンドを実行、メトリクスを取得。
  4. 保持またはロールバック – メトリクスが改善し(かつガードを通過した場合)は変更を保持、それ以外はロールバック。
  5. 目標に到達するか、ハードストップが発生するまで繰り返す。

すべての状態は autoresearch-results/ フォルダ内(JSONL イベントログ、HTML レポート、ログなど)に保存され、リポジトリにステージングされません。


主な機能

機能 重要性
Git ベースの安全対策 – すべての試行はコミット;失敗時は git revert でロールバック。 再現可能で監査可能な履歴を保証。
メトリクス駆動ループ – 単一の数値(または数値キーを持つJSON)を出力する任意のコマンドが目的に使用可能。 テスト失敗、カバレッジ、レイテンシ、バイナリサイズ、セキュリティ警告などに対応。
フォアグラウンド・バックグラウンドモード – 現在のCodexタスクで対話的に実行するか、夜間も継続するワーカーを分離。 すばやい調整や長時間の最適化に柔軟に対応。
明示的な承認 – 最初の編集前に目標、範囲、メトリクス、ガード、モードを表示;承認が必要。 意図しない変更を防止。
豊富なレポート – 不変の run.json、追記専用の events.jsonl、メトリクスの推移を可視化する自己完結型の report.html 監査・結果共有が容易。
安全モデル – 範囲外の編集、不正なメトリクス、タイムアウト、ガード失敗は明確なエラーで実行を中止。 自律実行の信頼性を確保。

一般的な利用例

  • 不安定なテストの修正 – テストスイートランナーで error_count = 0 を目標とする。
  • バイナリサイズの削減du -b が報告するサイズをメトリクスとする。
  • パフォーマンス向上 – ベンチマークスクリプトで測定したレイテンシをメトリクスとする。
  • セキュリティ強化の自動化 – 静的解析警告の数をメトリクスとする。
  • 段階的なリファクタリング – 単一の数値で表現可能な任意の測定可能な品質。

クイックインストールと初回実行

# スキルのインストール(最近のCodexリリースが必要、スキルインストーラー対応)
skill-installer install https://github.com/leo-lilinxiao/codex-autoresearch

# Codexに完全書き込み権限を持つクリーンリポジトリを開く
codex --dangerously-bypass-approvals-and-sandbox

# 実験を開始(例:error_count → 0 へ駆動)
$codex-autoresearch
# ベースライン、目標、範囲、検証コマンドなどについてプロンプトが表示される
# 承認後、フォアグラウンドまたはバックグラウンドでCodexを実行。

手動インストールは docs/INSTALL.md を参照。


ループの仕組み(簡略化)

検証情報の検査 → 1つの変更案を提案 → コミット&メトリクス実行 →
   改善したかつガード通過 → コミットを保持
   それ以外 → コミットをロールバック
イベントを events.jsonl に追加 → 目標到達まで繰り返す

コントロールスクリプト が Git 操作と状態ファイルを管理;Codex が仮説生成とコード編集を担当。


セキュリティと信頼性

  • すべての試行は 実際の Git コミットであり、メモリ内編集ではない。
  • 改善しない、またはガードに失敗する試行は自動的にロールバックされる。
  • 不正なメトリクス、コマンド失敗、タイムアウト、リポジトリの変更(例:ブランチ変更)が発生すると実行を中止。
  • ファイルはステージングされない;すべてのアーティファクトは autoresearch-results/ 内に保持。
  • 保持されたメトリクスが確認済みの目標を満たした場合のみ、実行は 完了 と報告される。

ドキュメントとヘルプ

  • インストールdocs/INSTALL.md
  • ユーザーガイドdocs/GUIDE.md(設定、ライフサイクル、トラブルシューティング)
  • docs/EXAMPLES.md(サンプルプロンプト、メトリクスパターン)
  • 貢献CONTRIBUTING.md
  • FAQ – READMEに組み込み(Git要件、停止・再開、完全アクセスの必要性など)

ライセンス

MIT – LICENSE を参照。


結論codex‑autoresearch は、Git ベースの実装により、OpenAI Codex が仮説駆動のコード変更を数値目標に達するまで実行できる、実用的で監査可能な自動化レイヤーです。完全な信頼性と安全性を備えており、AI支援開発の最前線に位置する本格的なソフトウェアプロジェクトです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト