“언어 모델로서”: 채팅 템플릿이 LLM의 자기 언급 말투를 전환함

1 hour ago 2

채팅 템플릿은 LLM이 자신에 대해 답하는 말투를 바꿈. 실험한 8개 지시 튜닝 모델 모두에서 템플릿을 적용하면 “저는 AI일 뿐입니다” 같은 한계 고지형 응답이 늘고, “저는 느낍니다” 같은 경험 서술형 응답은 줄어듦 템플릿을 제거하자 한계 고지형 응답 비율은 53%에서 36%로 감소하고, 경험 서술형 응답은 1%에서 15%로 증가함. 자기 언급 자체의 비율은 두 조건 모두 높게 유지됨 3개 모델의 활성화 공간에서 이 말투를 조절하는 방향 벡터를 찾음. 벡터를 더하면 한계 고지가 늘고 빼면 줄었으며, 같은 크기의 무작위 방향은 대체로 영향이 작았음 템플릿 없이 생성하는 지시 튜닝 모델에도 활성화 조향(activation steering) 을 적용하면, 한계 고지 비율을 템플릿이 있는 조건과 같은 수준으로 높일 수 있었음 모델의 자기 서술은 가중치뿐 아니라 채팅 템플릿에 의해서도 달라짐. 자기 보고나 내성을 연구할 때 템플릿을 교란 요인으로 통제해야 하며, 자기 서술을 문자 그대로 또는 유일한 진실의 근거로 취급해서는 안 됨 연구 질문과 자기 보고의 해석 모델이 자신과 사고 과정, 지식에 대해 말하는 자기 보고는 AI 안전을 비롯한 행동 연구와 기계론적 연구의 주요 데이터원임 관련 연구는 모델 내부의 개념 표현, 자기 이해, 아는 것과 모르는 것에 대한 인식, 자기 언급 상황에서의 주관적 경험 보고를 조사함 기반 모델과 지시 튜닝 모델의 차이, 채팅 템플릿의 영향도 연구됐지만, 템플릿이 자기 언급에 미치는 영향은 충분히 연구되지 않았음 핵심 질문은 채팅 템플릿이 자기 언급 말투를 결정하는지, 그리고 그 말투를 조절하는 방향을 모델 내부에서 찾을 수 있는지임 모델과 비교 설계 Llama, Gemma, Mistral, Qwen 계열에서 10억~90억 매개변수 규모의 기반 모델/지시 튜닝 모델 8쌍을 비교함 4개 범주의 응답을 세 가지 생성 조건에서 수집하고, 사람이 검증한 LLM 평가자로 점수를 매김 기반 모델에서 생성함 지시 튜닝 모델에 채팅 템플릿을 적용해 생성함 지시 튜닝 모델에 채팅 템플릿을 적용하지 않고 생성함 기반 모델과 지시 튜닝 모델, 템플릿 유무를 비교해 가중치와 템플릿의 기여를 분리하고, 활성화 조향 벡터를 추출해 한계 고지 비율에 미치는 영향을 시험함 연구진이 아는 범위에서는 이 분해 설계를 자기 언급에 적용한 첫 사례임 템플릿 유무에 따른 말투 변화 자기 언급을 유도하는 프롬프트에서 한계 고지...

Read Entire Article