Claude의 ‘워터마크’가 글쓰기를 왜곡하는 방식

1 hour ago 3

Anthropic은 EU 규정 준수를 위해 전 세계 Claude 모델이 생성하는 200토큰 초과 텍스트에 워터마크를 적용할 예정이며, 보이지 않는 문자가 아니라 비밀 키로 단어 선택 확률을 조정하는 방식임 다음 토큰 후보를 동적으로 ‘green’과 ‘red’로 나누고 green 후보를 조금 더 자주 선택해 통계적 흔적을 남기므로, 모델이 판단한 최적의 단어 대신 워터마크에 유리한 단어가 선택될 수 있음 Anthropic과 Google은 품질·의미·가독성에 실질적 영향이 없다고 하지만, 동의어도 의미와 뉘앙스가 같지 않으며 Gemini의 약 2,000만 개 응답 실험도 thumbs-up/down 차이가 통계적으로 유의하지 않다는 결과만 보여줌 흔적은 길고 많이 생성된 텍스트일수록 탐지하기 쉽지만 의도적인 재작성으로 제거할 수 있고, 교정·요약·인용·번역을 거친 인간의 글도 Claude가 작성한 것으로 의심받을 수 있어 정직한 사용자에게 더 큰 부담을 줌 생성과 탐지에 필요한 비밀 키를 Anthropic만 보유하므로 사용자는 직접 검증할 수 없으며, 모든 단어가 의미와 문체를 위해 선택됐는지 비밀 워터마크 때문에 선택됐는지 알 수 없게 됨 Claude 텍스트 워터마크의 작동 원리 Anthropic의 최초 지원 문서는 Claude가 의미·품질·가독성을 바꾸지 않는 “감지할 수 없는 워터마크”를 텍스트에 삽입한다고 밝혔지만 구체적인 원리는 공개하지 않았음 이 설명 때문에 보이지 않는 비출력 Unicode 문자를 삽입하는 방식일 수 있다는 추측이 나왔음 이후 공개된 How Claude’s Text Watermark Works는 숨은 문자를 추가하지 않고 토큰 선택을 조정한다고 밝힘 How AI Text Watermarking Works의 설명처럼, 이 방식은 편향된 동전을 여러 번 던져 편향 여부를 통계적으로 판별하는 것과 유사함 LLM은 다음 토큰마다 여러 후보 가운데 하나를 선택함 후보 토큰은 각 생성 지점에서 결정론적으로 green·red 목록에 배정되며, 같은 단어도 문맥에 따라 다른 목록에 들어갈 수 있음 워터마크가 활성화되면 green 후보의 선택 확률은 높아지고 red 후보는 낮아지지만, red 후보가 완전히 배제되지는 않음 비밀 키를 보유한 제공자는 각 지점에서 특정 단어가 어느 목록에 속했는지 계산하고, 예상보다 green 단어가 많은지 분석해 워터마크를 확률적으로 판별함 텍스트가 길수록 판별 신뢰도가 ...

Read Entire Article