zhengkid/Dream-RSI

The offical repo for "Dream-RSI: Recursive Self-Improvement through Evolving Worlds"

解決的問題

AI代理的遞歸自我改進(RSI)經常面臨探索效率低下的問題。隨著目標變得越來越複雜,代理會因固定探索策略無法適應而浪費大量計算資源在無效的搜尋方向上,且在線優化這些策略因反饋延遲和成本高昂而不可行。

工作原理

Dream-RSI 將累積的發現歷史視為一個回放模擬器。無需重新運行高成本的發現代理或評估器,系統利用過去探索決策及其結果的記錄樹,構建一個代理可以「做夢」的「世界」。

該過程遵循一個持續循環:

  1. 線上探索:當前策略驅動發現,並記錄所有軌跡。
  2. 模擬器建構:這些記錄的樹結構被轉換為可重用的模擬器池。
  3. 基於夢境的改進:透過在現有池中模擬路徑,對候選策略進行評估和優化,提供即時、低成本的離策略反饋。
  4. 重新部署:將改進後的策略重新部署到線上,進一步擴展池的規模。

適用對象

致力於遞歸自我改進、自動程式發現以及解決複雜最佳化或工程問題的AI代理的元學習的研究人員和開發者。

亮點

  • 歷史作為回放模擬器:將過去的發現日誌轉化為模擬器,使延遲反饋可重用,實現高效的策略評估。
  • 元層RSI循環:在不改變底層編碼代理的前提下,專門在探索層實現自我改進循環。
  • 已驗證的效率:在演算法工程、數學最佳化和GPU內核工程中均表現出改進,顯著減少發現所需的計算量並提升性能。

相關

  • 專案
  • 專案
  • 專案
  • 專案