Human-Agent-Society/reef

Continual learning infra for self-improving agents

何を解決するか

Reefは自己改善型AIエージェントを作成するためのインフラを提供します。新しいデータやフィードバックが到着したときに、モデルやエージェント構成を手動で更新する問題を、サービス提供、フィードバックの観察、更新のトレーニング、デプロイのサイクルを中断せずに自動化することで解決します。

動作方法

Reefは継続的学習バックエンドとして、4段階のサイクルを用いて動作します:

  1. 提供:OpenAIおよびAnthropic互換のHTTPエンドポイントを提供し、エージェントのリクエストを処理し、すべての相互作用を記録します。
  2. 観察:ユーザーまたは検証者が報告したフィードバック(スコアやテキスト)を、記録された相互作用にマッチさせます。
  3. 成長:「レシピ」を使用して、対象となる記録に基づいて更新を生成します。これらの更新は、モデルの重みまたはエージェントの「ハーネス」(ルール、スキル、プロンプト、拡張機能)のいずれかを対象とできます。
  4. コミット:候補となる更新を現在のバージョンと比較し、より良いパフォーマンスを示した場合、バージョン履歴に公開します。

対象ユーザー

現実世界の経験とフィードバックループを通じて、時間の経過とともにパフォーマンスを向上させる必要がある自律エージェントを開発する開発者。

特徴

  • 二重表面学習:下位のモデル重みと上位のエージェントハーネス(スキルやプロンプト)の両方を進化させることができます。
  • ダウンタイムゼロの更新:再起動を必要とせずに、更新された重みと構成をサービスランタイムに同期できます。
  • 標準化されたAPI:推論とフィードバック報告に標準的なHTTPエンドポイントを使用しており、既存のワークフローへの統合が簡単です。
  • レシピベースのアーキテクチャ:テストでスコア付けされたタスクや、次の状態信号を持つエージェントトラフィックなど、さまざまなワークロード向けのレシピのカタログを備えています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト