Show GN: ABTO : 실제 유저의 전환율과 비용으로 비교하는 LLM 모델 A/B 테스트

3 hours ago 1

더 값싼 LLM으로 바꾸고 싶은데, 유저가 이탈할까봐 못 바꾸고 있나요? 안녕하세요! 이 문제를 해결하기 위해 ABTO를 만들고 있습니다. 흔히 AI 기능에 쓸 모델을 고를 때 벤치마크 보고, 프롬프트 계속 돌려보고, 답변을 비교해가며 선택합니다. 그런데 그렇게 고른 모델이 실제 서비스에서도 좋은 선택인지는 별도로 확인해야만 하죠. 비싼 모델을 쓴다고, 답변이 더 길고 자세하다고 유저가 더 오래 서비스를 사용하거나 결제를 더 많이 하는 건 아닐 수 있으니까요. 저희는 여기서 큰 불편함을 발견했습니다. 기존 Langfuse, Mixpanel 같은 도구들은 단편적으로 유저 지표를 보거나, LLM 지표는 볼 수 있어도 이 둘을 묶어서 하나의 흐름으로 보면서 테스팅 해볼 수가 없었거든요. 결국 서비스 운영자 입장에서 확인하고 싶은 것은 Claude를 쓸 때 비용 당 매출을 일으키는 유저 액션이 얼마인지, Gemini를 쓸 때 비용 당 매출을 일으키는 유저 액션이 얼마인지 이런 것을 알아보고 개선시키고 싶은데 말이죠. ABTO는 실제 서비스의 트래픽을 모델별로 나눠서 호출 비용과 이후 유저 행동을 함께 비교하는 LLM A/B 테스트 도구입니다. LLM Router + Posthog(or GA, Mixpanel) 라고 생각해주시면 이해가 편하실 거 같습니다. 예를 들어 AI 글쓰기 서비스라면 다음처럼 사용할 수 있습니다. 초안 생성 기능에 모델 A와 B를 연결합니다. 각 모델로 보낼 트래픽 비율을 정합니다. (ex. 10% vs 90%, 50% vs 50% 등) 유저가 생성한 초안과, 저장하거나 공유한 초안, 결제 등을 각각 이벤트로 연결합니다. 보고 싶은 성과 지표를 설정합니다. 각 모델 별 유저가 생성한 초안 대비 저장하거나 공유한 초안 비율 각 모델 별 결제 비율 각 모델 별 성과 지표를 비교하고, 결과를 보고 어느 모델이 비용 대비 효과가 좋은지 판단하고, 트래픽 비율을 조정해볼 수 있습니다. 이렇게 “어느 모델의 답변이 더 좋아 보이는가”에서 한 걸음 더 나아가, "우리 서비스 유저가 어느 모델의 결과를 실제로 자주 사용하는가"를 ABTO에서 확인할 수 있습니다. 초안 생성과 첨삭처럼 기능을 나눠 각 기능별로 비교할 수도 있습니다. 최대한 속도와 안정성을 보장하기 위해 다음과 같이 구현했어요. Gateway는 Go 기반이며 Goroutine으로 최대한 동시성을 챙겼어요. SDK, Gateway에서 여러 단계의 f...

Read Entire Article