greyhaven-ai/autocontext

a recursive self-improving harness designed to help your agents (and future iterations of those agents) succeed on any task

解決する課題

autocontext は、AIエージェント向けの再帰的自己改善ハーネスを提供します。タスクの評価実行、有用な教訓の抽出、行き止まりの破棄を自動化することで、エージェントの不一致や失敗の問題を解決し、以降のイテレーションが特定の目標においてより良いパフォーマンスを発揮するようにします。

仕組み

システムはループとして機能します。自然言語の目標を受け取り、指定されたエージェントプロバイダー(Anthropic、OpenAI、または vLLM/Ollama 経由のローカルモデルなど)を使用してタスクを実行し、結果を評価します。その後、次回の実行のコンテキストとして機能するアーティファクト(プレイブック、レポート、データセットなど)を生成します。

主な技術的メカニズムは以下の通りです:

  • 結果ゲート付きコンテキストバンドル:不変な改善候補は、有効化される前に評価によってスクリーニングおよび確認されます。
  • 因果帰属:システムは、アブレーションに基づく帰属を使用して、どの特定のコンテキスト変更が実際に結果を改善したかを特定し、低価値の編集が昇格されるのを防ぎます。
  • 耐久性のあるキャンペーン:長時間実行される評価は、重複したプロバイダーのコストを回避するために、再起動セーフなスケジューリングと会計処理で管理されます。
  • 蒸留:安定した動作は、train コマンドを介してより安価な Python ランタイムに蒸留できます。

対象者

マニュアルでのプロンプトエンジニアリングを超え、エージェントの最適化と信頼性に対して体系的かつ証拠に基づくアプローチを採用したいと考える、エージェントを構築する開発者や AI 研究者向けに設計されています。

ハイライト

  • マルチプロバイダーサポート:Pi、Anthropic、OpenAI、OpenRouter、および自己ホスト型のローカルモデルと互換性があります。
  • ファイルシステムファーストアーキテクチャ:すべてのトレース、生成物、知識(プレイブック、ヒント)はファイルとして保存され、簡単に検査や差分比較が可能です。
  • MCP 統合:Model Context Protocol (MCP) サーバーとして提供でき、Claude Code や Cursor などのクライアントで使用できます。
  • カーネル進化:matmul や causal-attention ファミリなどの低レベル操作を最適化するための専門的な研究をサポートします。
  • TUI と CLI:実行の管理と監視のために、コマンドラインインターフェースとターミナルユーザーインターフェースの両方を提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト