Human-Agent-Society/reef

Continual learning infra for self-improving agents

解决的问题

Reef 为创建自我改进的 AI 代理提供基础设施。它通过自动化服务、观察反馈、训练更新和部署的循环,解决了在新数据或反馈到达时手动更新模型或代理配置的问题,且无需中断服务。

工作原理

Reef 作为一个持续学习后端,采用四步循环工作:

  1. 服务:提供与 OpenAI 和 Anthropic 兼容的 HTTP 端点,用于服务代理请求并记录每次交互。
  2. 观察:将用户或验证者报告的反馈(评分或文本)与记录的交互进行匹配。
  3. 成长:使用「配方」基于符合条件的记录生成更新。这些更新可针对模型权重或代理的「 harness 」(规则、技能、提示和扩展)。
  4. 提交:将候选更新与当前版本进行评估,若表现更优则发布到版本历史中。

适用人群

需要通过现实世界经验与反馈循环,随时间持续提升性能的自主代理开发者。

特色亮点

  • 双层学习:可同时进化底层模型权重和高层代理 harness(技能与提示)。
  • 零停机更新:无需重启即可将更新后的权重和配置同步到服务运行时。
  • 标准化 API:使用标准 HTTP 端点进行推理和反馈报告,便于集成到现有工作流中。
  • 配方驱动架构:提供多种工作负载的配方手册,例如由测试评分的任务或带有下一状态信号的代理流量。

相关

  • 项目
  • 项目
  • 项目
  • 项目