TypeSafe의 Jev가 내가 쓴 모든 글을 0.7초 만에 평가했다

6 days ago 18

TypeSafe의 Jev는 자연어 질문에 서술형 답변 대신 예/아니요 또는 사용자가 정의한 범주별 확률을 반환해, 코드가 곧바로 판단에 활용할 수 있는 모델임 글의 반복, 억지 양비론, 과도한 설명 등 21개 기준으로 글 37개를 검사해, 777건의 판단을 0.7초 미만에 반환했으며 추정 비용은 0.25센트였음 코드 파일 찾기, 고객 지원 답변 평가, 위험한 에이전트 행동 표시 등 11개 실험에서 총 1,709건을 판단했으며 추정 비용은 1센트 미만이었음 별도의 글쓰기 검사에서는 Fable 5.1보다 약 25배 빠르고 비용은 약 580배 낮았으며, 의도적으로 넣은 결함 7개 중 Jev는 6개만 탐지하고, Fable은 7개 모두 찾아냄 완성된 결과를 한 번 평가하는 대신 에이전트가 문단을 쓸 때마다 검사하고, 문제가 있으면 작성 모델이 다시 검토하는 ‘지식 업무용 린터’ 로 활용할 수 있음 코드가 바로 사용할 수 있는 확률형 답변 기업의 백그라운드 업무에는 고객 문의 분류, 청구서와 구매 주문 대조, 사기 가능성이 있는 거래 탐지처럼 빠르고 저렴하며 신뢰할 수 있는 AI 처리가 필요함 새 AI 연구소 TypeSafe가 출시한 Jev는 모호하거나 주관적인 자연어 질문에도 구조화된 확률값을 반환함 “이 고객이 화가 난 것 같은가?”에 0.9를 반환하면, 학습한 내용을 바탕으로 ‘그렇다’일 확률을 90%로 추정한다는 뜻임 짜증, 불쾌감, 모욕감, 격분, 극도의 분노처럼 범주를 직접 정의하고, ‘격분’ 60%, ‘극도의 분노’ 10%처럼 범주별 확률을 받을 수도 있음 소프트웨어는 0.9일 때 관리자에게 문의를 이관하고 0.1일 때 우선순위를 낮추는 식으로 다음 행동을 결정할 수 있음 일반 챗봇은 숫자 대신 고객의 감정에 공감하거나 답장 작성을 제안하는 문장을 출력할 수 있어, 0~1 사이 숫자를 기대하는 프로그램이 정상 작동하지 못할 수 있음 Python 프레임워크 DSPy로 LLM의 출력 형식을 유도할 수 있지만, 여전히 텍스트를 구조화된 코드처럼 동작하도록 맞추는 방식임 Jev는 이를 기본 기능으로 처리해 빠르고 저렴하지만, 실제 판단 품질은 추가 검증이 필요한 상태임 확신도 보정과 병렬 판단을 위한 설계 TypeSafe의 Reinforcement Learning for Calibrated Decisions(RLCD) 는 모델의 확신도와 실제 정답 비율을 맞추는 것을 목표로 함 고객 메시지 100개에 각각 분노 확률...

Read Entire Article