Dream-RSI: 진화하는 세계를 통한 재귀적 자기 개선

1 day ago 9

Dream-RSI는 코딩 에이전트 자체를 바꾸지 않고, 어느 탐색을 이어가고 병렬화하며 중단할지 결정하는 탐색 정책 코드를 반복적으로 개선하는 프레임워크임 완료된 탐색 이력을 재생 시뮬레이터로 만들어 대안 정책을 저비용으로 평가함. 코딩 에이전트와 평가기를 다시 실행하지 않지만, 기록에 없는 결과를 생성할 수는 없음 온라인 탐색 → 시뮬레이터 구축 → 오프라인 정책 개선을 반복함. 개선된 정책을 온라인에 배포해 새 탐색 이력을 수집하고 시뮬레이터 풀을 확장함 알고리듬 공학, 수학 최적화, GPU 커널 공학의 8개 과제에서 경쟁력 있는 결과를 얻음. Lasso에서는 SimpleTES보다 빠른 해법을 탐색 에이전트 호출 최대 약 162배 적게 사용해 찾음 성능 개선은 과제별로 차이가 있음. 수학의 자기상관 과제에서는 최고 비교 결과에 미치지 못했으며, 정책 선택의 비악화 보장도 고정된 과거 이력의 평균 재생 점수에만 적용됨 고정 탐색과 온라인 정책 최적화의 병목 재귀적 자기 개선(RSI)의 기본 과정은 후보 생성, 평가, 피드백 반영, 다음 시도 개선을 반복하는 탐색 루프임 알고리듬 설계, 개방형 수학 최적화, 시스템 설계, 에이전트 자기 개선에 활용되며, 어려운 과제에서는 수천 번의 생성/평가 주기가 필요함 장기 탐색에서 부적절한 탐색 조율은 계산 자원과 시간을 낭비하고 확장성을 제한함 수작업으로 만든 고정 탐색 전략은 축적된 경험으로 개선되지 않으며, 비효율적인 방향에 계산 자원을 반복 배정할 수 있음 탐색 정책을 온라인에서 최적화하는 방식에도 두 가지 병목이 있음 지연되고 비싼 피드백: 개별 후보와 달리 정책의 품질은 여러 생성/평가 주기에 걸친 탐색 결과를 관찰해야 판단할 수 있음 방대한 메타 정책 공간: 새 정책이 나쁠 수 있어 많은 대안을 시험해야 하고, 각 시험에 긴 온라인 실행이 필요함 탐색 이력을 재생 가능한 세계로 활용 완료된 탐색 이력은 과거 의사결정과 코드 실행 결과를 담은 탐색 트리로 구성할 수 있음 기존의 정적 텍스트 문맥이나 가중치 미세조정용 데이터 활용과 달리, 이미 관찰한 탐색 공간을 재생하는 시뮬레이터로 사용함 논문에서 재생 시뮬레이터(replay simulator) 와 세계(world)는 같은 의미로 쓰임 이 접근은 한 번 이동하며 만든 지도로 실제 장소를 다시 방문하지 않고 경로를 검토하는 방식과 같음 모델 기반 강화학습, World Models, Dreamer 계열처럼 실제 상...

Read Entire Article