Human-Agent-Society/reef
Continual learning infra for self-improving agents
解決的問題
Reef 提供建立自我進化 AI 代理的基礎設施。它透過自動化服務、觀察回饋、訓練更新與部署的循環,解決了當新資料或回饋到達時,手動更新模型或代理設定的問題,且無需中斷服務。
工作原理
Reef 作為持續學習後端,採用四階段循環運作:
- 提供:提供與 OpenAI 及 Anthropic 相容的 HTTP 端點,用於服務代理請求並記錄每次互動。
- 觀察:將使用者或驗證者報告的回饋(分數或文字)與記錄的互動進行匹配。
- 成長:使用「配方」根據符合資格的記錄產生更新。這些更新可針對模型權重或代理的「harness」(規則、技能、提示與擴充)。
- 提交:將候選更新與目前版本進行評估,若表現更佳則發布至版本歷史中。
適用對象
需要透過現實世界經驗與回饋迴圈,隨時間持續提升效能的自主代理開發者。
特色亮點
- 雙層學習:可同時進化底層模型權重與高階代理 harness(技能與提示)。
- 零停機更新:無需重新啟動即可將更新後的權重與設定同步至服務執行時。
- 標準化 API:使用標準 HTTP 端點進行推論與回饋報告,便於整合至現有工作流程。
- 配方驅動架構:提供多種工作負載的配方手冊,例如由測試評分的任務或帶有下一狀態信號的代理流量。
相關
- 專案
- 專案
- 專案
- 專案