역공학으로 구현한 Jev 유사 모델

8 hours ago 5

Jevlike는 텍스트 문맥과 매번 달라질 수 있는 선택지 목록을 받아, 답을 단어별로 생성하지 않고 한 번의 처리로 선택지별 확률을 계산하는 소형 모델임 각 선택지를 쿼리 벡터로 만들어 문맥 토큰에 어텐션을 적용하고, 선택지별 문맥 벡터와의 점수를 계산한 뒤 softmax로 확률을 구함 기본 구성은 바이트 임베딩을 처음부터 학습하며, 선택적으로 가중치를 고정한 Hugging Face 사전학습 인코더에 작은 점수 계산 헤드만 학습할 수 있음 로컬 실험에서 합성 선택지 정확도는 약 98%, 목표 페이지를 분리한 Wikispeedia 다음 클릭 예측 정확도는 구성에 따라 26~29% 였으며, 빠른 시작 예제의 재현 결과는 아님 TypeSafe가 Jev 설계를 공개하지 않은 상태에서 만든 독립적인 연구용 출발점으로, Jev와 동등한 품질이나 비공개 학습 방식의 재현을 입증하지 않았음 목적과 처리 구조 Jevlike는 텍스트 하나와 N개의 텍스트 선택지를 입력받아 각 선택지의 확률을 반환함 Jev는 TypeSafe의 같은 유형 작업용 상용 모델이지만 설계는 공개되지 않았음 이 저장소는 Jev를 복제한 모델이 아니라, 입출력 형태가 같은 독립적인 초기 모델임 선택지 어텐션 헤드는 각 선택지를 텍스트를 나타내는 쿼리 벡터로 변환함 쿼리가 문맥 토큰에 어텐션 가중치를 부여해 선택지별 문맥 벡터를 만듦 공통 내적 연산으로 선택지와 문맥 벡터 쌍을 점수화하고, 선택지 전체에 softmax를 적용해 합이 1인 확률을 계산함 기본 인코더는 바이트 임베딩을 처음부터 학습함 선택적 Hugging Face 경로에서는 사전학습 인코더의 가중치를 고정하고 작은 점수 계산기만 학습함 데이터와 학습 및 평가 흐름 학습 데이터는 한 줄에 JSON 객체 하나를 담는 JSONL 형식이며, context, options, label 필드를 사용함 label은 정답 선택지의 0부터 시작하는 인덱스임 행마다 선택지 수가 달라도 되지만 최소 2개가 필요함 기본 작업 흐름은 합성 데이터 생성 → 학습 → 저장한 모델 평가 → 새 선택지 목록 예측 순서임 평가에서는 Top-1/Top-3 정확도와 기대 보정 오차를 계산함 Top-1은 가장 높은 점수의 선택지가 정답인 비율, Top-3는 상위 3개 안에 정답이 있는 비율임 기대 보정 오차는 예측 신뢰도와 관측 정확도를 비교함 선택지 목록에 잘못된 문맥을 연결하는 문맥 셔플 대조군도 출력하며, 유용한 모델은 이 ...

Read Entire Article