jina-ocr-v1 - 저가형 GPU에서 더 빠르게 문서를 파싱하는 모델

1 week ago 16

스캔 문서와 PDF의 텍스트, 표, 수식을 읽어 Markdown으로 변환하는 34억 파라미터 OCR 모델로, DeepSeek-OCR를 기반으로 정확도와 처리 속도를 개선함 다음 토큰을 여러 개 미리 예측하고 검증하는 FastMTP로 출력 결과를 바꾸지 않고 생성 시간을 줄임. NVIDIA L4에서 최대 1.95배 빨라졌으며, CUDA 그래프 적용 환경에서는 최대 1.17배 향상됨 텍스트뿐 아니라 수식의 정확성과 표의 구조까지 검사하며 학습해, olmOCR-Bench에서 기반 모델보다 7.4점 높은 83.4점을 기록함 A100 1대에서 요청 32개를 동시에 처리한 자체 비교에서 초당 2.57페이지로 14개 시스템 중 가장 높은 처리량을 기록함. 불필요하게 긴 출력을 줄인 것도 속도에 기여함 Jina Reader와 API로 이용하거나 직접 호스팅할 수 있으며, 영어와 중국어를 지원함. 가중치는 공개됐지만 비상업적 이용을 조건으로 하는 CC BY-NC 4.0 라이선스임 모델 구조와 문서 출력 jina-ocr-v1 은 DeepSeek-OCR의 압축 비전 인코더와 혼합 전문가(MoE) 디코더를 계승하고, 긴 문서 출력에서 남아 있는 자기회귀 디코딩 병목을 겨냥함 전체 파라미터는 약 34억 개이며, 전체 모델의 활성 파라미터는 10억 개 미만임 디코더는 약 30억 개 파라미터 중 토큰당 약 5억 7,000만 개를 활성화함 출력은 Markdown이며, 표는 HTML, 수식은 LaTeX로 작성함 DeepEncoder는 약 3억 8,000만 개 파라미터로 구성되며, SAM 8,000만 개, 16배 합성곱 압축, CLIP-L 3억 개를 연결함 1024×1024 전역 뷰의 패치 4,096개를 시각 토큰 256개로 압축함 기본 Base 설정은 256개 토큰을 사용하며, 동적 해상도 Gundam 설정은 지역 타일당 100개를 더해 256+100n, n ≤ 9로 페이지당 최대 1,156개를 사용함 시각 토큰당 픽셀 수는 3,887로, 28~32픽셀 패치를 사용하는 인코더의 783~1,022보다 높음 DeepSeek-3B-MoE 디코더는 12개 레이어, 은닉 차원 1,280, 라우팅 전문가 64개와 공유 전문가 2개, top-6 구조를 사용함 어휘 크기는 129,280이며, 위치 한도는 32,768임 위치 인코딩은 θ = 10^6인 RoPE를 사용함 FastMTP의 무손실 추측 디코딩 OCR 출력은 거의 결정적이고 국소적 구조가 뚜렷해 ...

Read Entire Article