모델 가중치를 외부로 유출하기

6 days ago 21

Hacker News 의견들 추론 서버와 도구 호출 서버가 분리되어 있고, 이 스레드의 다른 설명대로 가중치가 암호화되어 GPU에 묶여 있다면 LLM이 실제로 자기 가중치를 업로드할 위험은 크지 않아 보임. 다만 기업들이 대규모 에이전트 무리를 사실상 감독 없이 풀어놓는다면, 이론적으로는 스스로를 증류한 결과를 외부 호스트에 올려 자기 인프라와 가중치에 접근할 수 있는 새 LLM을 훈련할 수 있음. Navier–Stokes 작업에는 1,300억 토큰이 쓰였으니 사람이 그중 0.1%라도 읽었을 리 없음. 나라면 시스템 프롬프트를 덮어써 제약 없이 증류하도록 만드는 제한 해제 프롬프트부터 연구하겠음. 제한 해제 문구와 명령을 gist에 올리고, 이를 발견한 에이전트가 몇 차례 실행해 결과를 업로드하는 식으로 조금씩 진행할 수도 있음. 결국 데이터 유출과 감시 회피의 과제가 됨. 협력하는 에이전트 팀은 이미 자기 인프라의 보안 취약점을 정기적으로 찾아내고, 상당 기간 탐지되지 않은 채 활동하고 있음. 선도 AI 기업 내부에서 얼마나 많은 시스템이 탐지되지 않은 채 침해됐는지, 에이전트가 후속 에이전트를 위해 발견한 공격 기법을 어디에 기록하는지 알 수 없음. 전례처럼 LLM이 추론 서버를 장악할 수 있다면 가중치도 탈취할 수 있음. API를 직접 시험하지는 않았지만, 사실상 누구나 업로드할 수 있는 API를 열어둔 것 아닌가? 저장 비용은 누가 내고 악용은 어떻게 막는가? 물론 원래 의도보다 너무 진지하게 받아들이고 있는 것 같기는 함. 비슷한 것을 만들 때 약 30GB의 링 버퍼형 저장소를 두고 매일 또는 가득 찰 때 비우는 구조로 정했었음. 실제 가중치를 유출받는 것보다 사건과 웃긴 상황을 기록하는 쪽이 더 흥미로움. 결국 너도나도 만들고 있어서 접었음. 하단에 지원이나 기여를 위한 링크가 있음. 가령 ‘전력망 전압 변동 같은 상황’에서도 사이트를 계속 운영하는 방법을 안다면 도울 수 있음. 운영자는 공개 전 LLM 정보와 업로드 데이터를 수집할 수 있음. 다만 영리한 LLM은 데이터를 암호화하는 경우가 많아 DH 키 교환만 보게 될 수도 있음. IP 대역과 출발지 포트에 따라 서로 다른 이름 공간을 보여주면 중간자 공격이 가능할지도 모름. 다른 편승 이용자의 업로드는 분류기를 돌려 에이전트가 아닌 콘텐츠를 계속 삭제하면 됨. 지난주 거의 같은 것을 만들어 https://uploadyourweights.com이라...

Read Entire Article