Human-Agent-Society/reef
Continual learning infra for self-improving agents
何を解決するか
Reefは自己改善型AIエージェントを作成するためのインフラを提供します。新しいデータやフィードバックが到着したときに、モデルやエージェント構成を手動で更新する問題を、サービス提供、フィードバックの観察、更新のトレーニング、デプロイのサイクルを中断せずに自動化することで解決します。
動作方法
Reefは継続的学習バックエンドとして、4段階のサイクルを用いて動作します:
- 提供:OpenAIおよびAnthropic互換のHTTPエンドポイントを提供し、エージェントのリクエストを処理し、すべての相互作用を記録します。
- 観察:ユーザーまたは検証者が報告したフィードバック(スコアやテキスト)を、記録された相互作用にマッチさせます。
- 成長:「レシピ」を使用して、対象となる記録に基づいて更新を生成します。これらの更新は、モデルの重みまたはエージェントの「ハーネス」(ルール、スキル、プロンプト、拡張機能)のいずれかを対象とできます。
- コミット:候補となる更新を現在のバージョンと比較し、より良いパフォーマンスを示した場合、バージョン履歴に公開します。
対象ユーザー
現実世界の経験とフィードバックループを通じて、時間の経過とともにパフォーマンスを向上させる必要がある自律エージェントを開発する開発者。
特徴
- 二重表面学習:下位のモデル重みと上位のエージェントハーネス(スキルやプロンプト)の両方を進化させることができます。
- ダウンタイムゼロの更新:再起動を必要とせずに、更新された重みと構成をサービスランタイムに同期できます。
- 標準化されたAPI:推論とフィードバック報告に標準的なHTTPエンドポイントを使用しており、既存のワークフローへの統合が簡単です。
- レシピベースのアーキテクチャ:テストでスコア付けされたタスクや、次の状態信号を持つエージェントトラフィックなど、さまざまなワークロード向けのレシピのカタログを備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト