zhengkid/Dream-RSI
The offical repo for "Dream-RSI: Recursive Self-Improvement through Evolving Worlds"
何を解決するか
AIエージェントにおける再帰的自己改善(RSI)は、効率の悪い探索に悩まされることがよくあります。ターゲットがより複雑になると、固定された探索戦略は適応できず、無駄な探索方向に膨大な計算リソースを消費します。また、オンラインでこれらの戦略を最適化しようとすると、遅延したかつ高コストなフィードバックのため、実行が非常に非効率です。
どう動くか
Dream-RSIは蓄積された発見履歴をリプレイシミュレータとして扱います。高コストな発見エージェントや評価器を再実行するのではなく、過去の探索意思決定とその結果の記録された木構造を用いて、エージェントが「夢見」られる「世界」を構築します。
このプロセスは連続ループで進行します:
- オンライン探索:現在のポリシーが発見を駆動し、すべてのトレースを記録します。
- シミュレータ構築:記録された木構造を再利用可能なシミュレータプールに変換します。
- 夢見に基づく改善:候補となるポリシーを、既存のプールを経由する経路をシミュレートすることで評価・改善し、即時かつ低コストなオフポリシーのフィードバックを提供します。
- 再デプロイ:改善されたポリシーをオンラインに再デプロイし、プールをさらに拡張します。
対象読者
再帰的自己改善、自動プログラム発見、複雑な最適化や工学的問題に取り組むAIエージェントのためのメタラーニングに取り組む研究者や開発者。
特徴
- 履歴をリプレイシミュレータとして利用:過去の発見ログをシミュレータに変換し、遅延フィードバックを再利用して効率的なポリシー評価を可能にします。
- メタレイヤーのRSIループ:下位のコーディングエージェントを変更せずに、探索レイヤーに特化した自己改善サイクルを実装します。
- 実証された効率性:アルゴリズム設計、数学的最適化、GPUカーネル設計において、発見に必要な計算量を削減し、性能を向上させることを実証しました。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト