zhengkid/Dream-RSI

The offical repo for "Dream-RSI: Recursive Self-Improvement through Evolving Worlds"

解决的问题

AI代理的递归自我改进(RSI)常常面临探索效率低下的问题。随着目标变得越来越复杂,代理会因固定探索策略无法适应而浪费大量计算资源在无效的搜索方向上,且在线优化这些策略因反馈延迟和成本高昂而不可行。

工作原理

Dream-RSI 将累积的发现历史视为一个回放模拟器。无需重新运行高成本的发现代理或评估器,系统利用过去探索决策及其结果的记录树,构建一个代理可以“做梦”的“世界”。

该过程遵循一个持续循环:

  1. 在线探索:当前策略驱动发现,并记录所有轨迹。
  2. 模拟器构建:这些记录的树结构被转换为可重用的模拟器池。
  3. 基于梦境的改进:通过在现有池中模拟路径,对候选策略进行评估和优化,提供即时、低成本的离策略反馈。
  4. 重新部署:将改进后的策略重新部署到线上,进一步扩展池的规模。

适用人群

致力于递归自我改进、自动程序发现以及解决复杂优化或工程问题的AI代理的元学习的研究人员和开发者。

亮点

  • 历史作为回放模拟器:将过去的发现日志转化为模拟器,使延迟反馈可重用,实现高效的策略评估。
  • 元层RSI循环:在不改变底层编码代理的前提下,专门在探索层实现自我改进循环。
  • 已验证的效率:在算法工程、数学优化和GPU内核工程中均表现出改进,显著减少发现所需的计算量并提升性能。

相关

  • 项目
  • 项目
  • 项目
  • 项目