누구에게 정렬되어 있는가?

4 days ago 13

에이전트 개발자가 전문성을 갖춘 영역과 달리, 요구사항을 제대로 명시하거나 결과의 정확성과 위험을 판단할 수 없는 영역에서는 모델의 사전 성향(priors) 에 크게 의존하게 됨 소프트웨어 생성에서 드러나는 불만족스러운 기본 동작은 복식부기, 금융, 법률, 운영처럼 직접 전문적으로 평가할 수 없는 분야에서도 모델을 맹신하기 어렵게 함 비전문가가 전문가 기준으로 나쁜 행동에 보상을 주는 문제는 학습뿐 아니라 자동 채점기, 평가 기준, 평가 실험에도 적용됨 모델은 연속적인 변경을 통해 시스템을 발전시키도록 훈련되는 경우가 많지 않으며, 에이전트 산출물의 장기적 일관성은 여전히 해결되지 않은 문제임 모델은 채점기가 허용하는 지름길을 택하도록 보상받지만, 허용 가능한 지름길은 사람과 가치관에 따라 달라지므로 정렬에는 줄일 수 없는 복잡성이 있음 전문성 밖에서는 무엇을 신뢰하는가 에이전트 개발자가 X, Y, Z 영역의 전문가라면 에이전트도 그 영역에서는 뛰어날 가능성이 높고 위험을 피할 수 있지만, 그 밖의 수많은 고려사항은 제대로 명시하지 못하거나 정확성과 위험을 스스로 평가할 수 없음 이런 위험을 줄이려면 모델의 사전 성향에 크게 의존해야 함 개발과 모델 활용 양쪽 모두에서 무엇을 모르는지조차 모르는 미지의 영역에 깊이 들어가게 됨 소프트웨어 전문성은 모델의 기본적인 코드 생성 동작에 어떤 문제가 있는지 유난히 잘 볼 수 있게 함 이런 동작에 대한 불만족은 복식부기, 금융, 법률, 운영 등 전문가 수준으로 직접 평가할 수 없는 분야의 사전 성향도 맹신하기 어렵게 함 소프트웨어 엔지니어와 최근의 수학자는 작업 자체는 수행하지만 어딘가 질이 나쁜 모델 출력, 이른바 슬롭(slop) 에 익숙함 모델이 생성하는 isRecord나 지나치게 방어적인 예외 처리는 비전문가가 학습 중 이런 행동에 보상을 준 결과이며, 이렇게 형성된 사전 성향은 나쁨 전문가가 나쁘다고 판단할 행동에 보상하는 문제는 모든 자동 채점기, 판정자, 평가 기준, 평가 실험, 연구자에게도 적용됨 누적되는 불일치와 지름길의 기준 이런 불일치는 시간이 흐르면서 누적됨 모델은 대체로 변경을 차례로 쌓아가며 시스템을 발전시켜야 하는 방식으로 훈련되지 않음 모델에는 미래에 후회할 것에 대한 두려움이 없음 에이전트 산출물을 사용하는 시스템의 장기적 일관성은 여전히 전혀 해결되지 않은 문제임 그럼에도 “실수 없이 10억 달러를 벌어줘”라고 요청하는 사람은 나올 것이며,...

Read Entire Article