zhengkid/Dream-RSI
The offical repo for "Dream-RSI: Recursive Self-Improvement through Evolving Worlds"
해결하는 문제
AI 에이전트에서의 재귀적 자기 개선(RSI)은 종종 비효율적인 탐색에 어려움을 겪습니다. 목표가 점점 더 복잡해질수록 고정된 탐색 전략은 적응할 수 없고, 비효율적인 탐색 방향에 막대한 계산 자원을 낭비하게 됩니다. 또한 온라인에서 이러한 전략을 최적화하는 것은 지연되고 비용이 큰 피드백으로 인해 너무 비효율적입니다.
작동 방식
Dream-RSI는 누적된 발견 기록을 리플레이 시뮬레이터로 간주합니다. 고비용의 발견 에이전트나 평가자들을 다시 실행하는 대신, 과거의 탐색 결정과 그 결과를 기록한 트리 구조를 사용하여 에이전트가 '꿈'을 꿀 수 있는 '세계'를 만듭니다.
이 과정은 지속적인 루프로 진행됩니다:
- 온라인 탐색: 현재 정책이 탐색을 이끌고 모든 추적 정보를 기록합니다.
- 시뮬레이터 구축: 기록된 트리는 재사용 가능한 시뮬레이터 풀로 변환됩니다.
- 드림 기반 개선: 후보 정책은 기존 풀을 통해 경로를 시뮬레이션하여 평가 및 개선되며, 즉각적이고 저비용의 오프폴리시 피드백을 제공합니다.
- 재배포: 개선된 정책은 다시 온라인으로 배포되어 풀을 더욱 확장합니다.
대상 사용자
복잡한 최적화나 공학 문제를 해결하는 AI 에이전트를 위한 재귀적 자기 개선, 자동 프로그램 발견, 메타러닝에 종사하는 연구자 및 개발자.
주요 특징
- 기록을 리플레이 시뮬레이터로 활용: 과거의 발견 로그를 시뮬레이터로 변환하여 지연된 피드백을 재사용해 효율적인 정책 평가를 가능하게 합니다.
- 메타 계층 RSI 루프: 기저의 코딩 에이전트를 변경하지 않고도 탐색 계층에서 특화된 자기 개선 사이클을 구현합니다.
- 실증된 효율성: 알고리즘 설계, 수학적 최적화, GPU 커널 설계에서 발견에 필요한 계산량을 줄이고 성능을 향상시켰음을 입증했습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트