500달러로 미세조정한 9B 오픈 모델, 카탈로그 검수에서 프런티어 모델 능가

5 days ago 13

전자상거래 카탈로그 검수용 9B 오픈소스 모델을 약 500달러로 강화학습 미세조정한 결과, 같은 도구·이미지·채점기를 사용한 모든 프런티어 모델 구성보다 높은 점수를 기록함 17만7,767개 검수 에피소드로 만든 디지털 트윈에서 상품 분류, 브랜드 확인, 속성 추출, 정책 판정을 반복해 기업 고유의 분류 체계와 판단 기준을 모델 가중치에 학습시킴 GRPO 학습 모델은 달성 가능한 최대 점수의 87.3% 를 기록해 최상위 프런티어 구성의 76.9%보다 상대적으로 13.5% 높았고, 미학습 기반 모델의 64.2%보다 36% 향상됨 비용은 상품 1,000개당 약 0.50달러로 가장 저렴한 프런티어 구성보다 40배, 가장 비싼 구성보다 약 340배 저렴하며, 하루 4,000만 건 규모에서는 연간 약 700만 달러와 5억 달러의 차이가 남 결과를 규칙·테스트·평가표로 검증할 수 있는 대량 반복 업무에 적합하며, 변하는 사실은 검색 도구에 두고 기업 고유의 판단 방식은 모델에 학습시키는 구조가 필요함 AI 투자 성과를 가르는 운영 방식 ChatGPT 출시 이후 AI 활용은 문서 요약과 이메일 초안 같은 저위험 업무에서 소프트웨어 개발, 콘텐츠 생성, 내부 지식·데이터·도구를 연결하는 회사 두뇌(company brain) 구상으로 확대됨 Ramp 고객 데이터에서 AI 지출 상위 25% 기업은 2022년 11월부터 2025년 12월까지 매출이 2배 이상 늘었지만, AI 지출이 없는 기업은 같은 기간 약 15% 성장함 성과를 내는 조직에는 다음 운영 방식이 반복됨 업무 흐름 재설계: 기존 절차에 모델만 추가하지 않고 승인, 검토, 인계와 인간 개입 지점을 다시 설계해야 함 McKinsey의 2025년 생성형 AI 이용 조직 조사에서 업무 흐름 재설계는 EBIT 영향과 가장 높은 상관관계를 보였지만, 실제로 하나라도 재설계한 조직은 21%에 그침 실험 장려: 모델과 도구, 모범 사례가 빠르게 바뀌므로 성공적인 출시뿐 아니라 실험과 실패 공유에도 보상이 필요함 맞춤형 업무 맥락: 데이터 접근, 요청별 접근 제어, 관련 근거 검색, 길어질수록 활용이 불균등해지는 컨텍스트 창 관리가 별도 엔지니어링 과제가 됨 사용량과 효과 측정: 자체 데이터에 대한 채점 평가가 없으면 성능, 의사결정 비용, 효율 영향을 입증하기 어려우며 자기 보고식 시간 절감 수치도 부정확할 수 있음 ‘지능 소유’를 위한 배포 방식 반복적으로 나타나는 구성은 오픈소...

Read Entire Article