자기 개선을 위한 하네스 엔지니어링

7 hours ago 5

재귀적 자기 개선(RSI)의 단기 경로는 모델이 직접 가중치를 고치는 것보다, 사고·도구·맥락·기억·평가를 조율하는 하네스 자체를 개선해 더 나은 연구·배포 시스템을 만드는 방식에 가까움 하네스는 단순 프롬프트를 넘어 워크플로 자동화, 파일 기반 영속 메모리, 병렬 서브에이전트, 권한 제어, 평가와 상태 관리를 아우르는 런타임·소프트웨어 시스템임 ACE·MCE·Meta-Harness는 최적화 대상을 구조화된 맥락에서 맥락 관리 기술과 하네스 코드까지 넓히며, ADAS·AFlow·STOP·Self-Harness·AHE는 실행 결과를 바탕으로 워크플로와 구성 요소를 반복 개선함 진화적 탐색은 평가 가능한 코드와 하네스를 폭넓게 탐색하며, DGM은 Claude 3.5 Sonnet 기반 에이전트의 SWE-bench Verified 성능을 20%에서 50%, Polyglot을 14.2%에서 30.7%로 높였지만 느리거나 모호한 평가에는 적용하기 어려움 완전한 자기 개선에는 모델 지능과 신뢰할 수 있는 평가가 필수이며, 보상 해킹, 맥락 수명주기, 다양성 붕괴, 장기 유지보수, 부정적 결과 보존 문제 때문에 평가기·권한·보안과 중요한 인간 감독은 개선 루프 외부에 둬야 함 재귀적 자기 개선과 하네스 I. J. Good의 1965년 개념은 인간의 모든 지적 활동을 능가하고 더 나은 기계를 설계할 수 있는 “초지능 기계”를 정의함 Yudkowsky의 2008년 정의는 AI가 현재 지능으로 자신의 지능을 생산하는 인지 장치를 개선하는 재귀적 피드백 루프를 가리킴 현대 AI의 RSI는 모델이 가중치를 직접 다시 쓰는 방식뿐 아니라, 훈련 파이프라인과 배포 시스템을 개선해 경제적으로 가치 있는 작업에서 더 나은 후속 모델을 만드는 방식까지 포함함 하네스(harness) 는 기반 모델을 둘러싸고 실행을 조율하는 시스템임 모델이 사고하고 계획하는 방식 도구 호출과 행동 맥락 인식과 관리 산출물 저장 결과 평가를 결정함 Claude Code와 Codex 같은 코딩 에이전트는 원시 모델 성능뿐 아니라 현실 맥락과 연결되는 배포 계층의 중요성을 보여줌 모델 자기대전, 합성 데이터, 테스트 시점 훈련, 지속 학습도 RSI와 관련되지만 하네스 엔지니어링의 직접 범위에서는 제외됨 하네스 설계 원칙 초기 에이전트 공식인 LLM + memory + tools + planning + action에서 더 나아가 워크플로 설계, 평가, 권한 제어, 영속...

Read Entire Article