Datalab Marker 2 vs MinerU·Docling·LiteParse: olmOCR-bench 76.0점과 5배 처리량으로 본 오픈소스 문서 파싱 경쟁 구도

  • olmOCR-bench에서 Datalab Marker 2는 76.0점을 기록해 MinerU, Docling, LiteParse와 비교한 정확도 우위를 확인함
  • Marker 2는 MinerU 대비 약 5배 처리량을 보여 정확도와 처리량을 동시에 끌어올린 결과로 주목됨
  • 오픈소스 문서 파싱 도구 선정에서 정확도와 처리량을 함께 평가해야 한다는 새로운 기준이 부상함

정확도와 처리량을 동시에 만족하는 도구 확보가 RAG와 에이전트 파이프라인의 실무 효율을 좌우하는 핵심 변수가 되고 있다.

오픈소스 문서 파싱(parsing) 도구 시장은 빠르게 다층화되고 있으며, 단순히 텍스트를 추출하는 수준을 넘어 레이아웃과 표, 수식까지 얼마나 정확하게 복원하느냐가 평가 기준으로 자리 잡고 있다. 이러한 흐름 속에서 olmOCR-bench는 여러 프로젝트의 성능을 동일한 지표로 비교할 수 있는 공개 벤치마크 역할을 하고 있다. 본 글에서는 Marker 2, MinerU, Docling, LiteParse 네 가지 프로젝트의 결과를 정량적으로 해부하고 한국어·다국어 실무에 미치는 시사점을 정리한다.

olmOCR-bench와 문서 파싱 오픈소스 경쟁 구도

olmOCR-bench 평가 지표와 참여 프로젝트 개관

olmOCR-bench는 Allen Institute for AI(AllenAI)에서 공개한 문서 OCR·파싱 모델 평가용 벤치마크로, 레이아웃 복원 정확도, 표 인식 정확도, 읽기 순서 복원, 수식 인식 등 문서 자동화 실무에서 중요한 항목들을 정량적으로 측정한다. 평가 결과는 점수 형태로 공개되며 동일 환경에서 여러 모델을 비교할 수 있다는 장점이 있다. Datalab Marker 2는 이 벤치에서 76.0점을 기록한 것으로 보고되었고, 같은 평가 환경에서 MinerU, Docling, LiteParse가 함께 비교 대상으로 등장했다. 공개 리포지토리에서는 리더보드 형태로 결과가 공유되어, 도입자가 사전 검토를 할 수 있도록 구성되어 있다.

정확도와 처리량을 동시에 본다는 것의 의미

기존 문서 파싱 도구 비교는 정확도 한 축에 집중되는 경향이 있었으나, 대규모 문서 코퍼스를 처리하는 실무에서는 단위 시간당 처리 가능한 페이지 수가 곧 비용과 직결된다. 따라서 정확도 점수와 함께 시간당 처리 페이지 수를 함께 고려하는 방식이 보편화되고 있다. olmOCR-bench의 결과가 단순 점수만이 아니라 처리량 비율까지 함께 공개되는 것은 이러한 변화를 반영한 것으로 해석된다.

Marker 2 vs MinerU vs Docling vs LiteParse 정량 비교

76.0점과 5배 처리량 수치의 해석

아래 표는 MarkTechPost 기사와 공개 벤치마크 데이터를 토대로 4종 도구의 핵심 지표를 정리한 것이다. 수치는 동일 평가 환경의 olmOCR-bench 기준이며, 처리량 비율은 MinerU를 1배로 환산한 상대값이다.

프로젝트 olmOCR-bench 점수 MinerU 대비 처리량 비율 주요 특징
Datalab Marker 2 76.0 약 5배 정확도와 속도 균형, PDF·이미지 광범위 지원
MinerU 공개 벤치 점수 공개 범위 1배(기준) 레이아웃·표 인식에 강점, 처리 속도는 상대적으로 느림
Docling 공개 벤치 점수 공개 범위 프로젝트별 상이 딥러닝 모델 기반, 모듈형 구조
LiteParse 공개 벤치 점수 공개 범위 프로젝트별 상이 경량 환경 우선, 정확도보다 단순 파싱에 초점

Marker 2가 76.0점이라는 수치를 기록하면서 MinerU 대비 약 5배의 처리량을 보였다는 것은 정확도와 처리량이라는 두 축을 동시에 끌어올린 결과로 해석된다. 이는 “정확한 도구는 느리다”라는 기존의 트레이드오프(trade-off) 가정이 더 이상 절대적이지 않음을 시사한다. 다만 4종 모두의 절대 점수는 평가 시점과 하드웨어 환경에 따라 달라질 수 있으므로, 공개 리더보드의 최신 수치를 함께 확인해야 한다.

프로젝트별 설계 철학과 권장 적용 시나리오

  • Marker 2: 정확도와 속도의 균형을 중시하며 대량 PDF를 빠르게 처리해야 하는 배치(batch) 파이프라인에 적합한 것으로 보인다.
  • MinerU: 레이아웃 복원과 표 인식 품질이 우선 순위인 학술·재무 문서에 강점이 있으나, 처리 시간이 길어질 수 있다.
  • Docling: 모듈형 구조로 특정 컴포넌트만 선택해 운용할 수 있어, 커스텀 파이프라인을 구성하는 팀에 적합하다.
  • LiteParse: 경량 환경을 우선시하므로 프로토타이핑이나 저사양 서버 환경에서 우선 검토될 수 있다.

저자 의견으로는, 한국어 문서가 다수 포함된 코퍼스를 다룬다면 레이아웃 인식 품질과 처리 속도 균형을 우선 평가하는 것이 합리적이며, 단순 한글 OCR이 아닌 표·수식·다단 레이아웃까지 포함된 문서라면 Marker 2 또는 MinerU 중 운영 환경에 맞는 도구를 사전 검증할 필요가 있다.

한국어·다국어 실무 적용 시사점

RAG 및 에이전트 파이프라인과의 결합 고려사항

검색 증강 생성 시스템에서 문서 파싱 도구는 인덱싱 단계의 품질을 결정짓는 핵심 컴포넌트다. 파싱 단계에서 표나 다단 구성이 깨지면 청크(chunk) 품질이 저하되고, 결과적으로 검색 정확도와 답변 품질이 함께 떨어진다. 또한 에이전트 기반 워크플로우에서는 여러 문서를 반복적으로 파싱해야 하므로 처리량이 응답 지연에 직접 영향을 미친다. Marker 2와 같이 정확도와 처리량을 동시에 만족하는 도구는 대규모 코퍼스 환경에서 운영비 절감과 응답 속도 개선에 동시에 기여할 가능성이 높다.

재현성, 하드웨어 의존도, 도입 체크리스트

오픈소스 도구를 실무에 도입할 때는 다음 항목을 사전에 점검할 필요가 있다.

  1. 동일 하드웨어에서 olmOCR-bench와 유사한 지표를 재현할 수 있는지 자체 측정한다.
  2. 한국어·일본어·중국어 등 비라틴 문자 코퍼스에서의 정확도를 별도 샘플로 검증한다.
  3. 메모리 사용량과 컨텍스트 윈도우 크기를 GPU 사양과 함께 검토한다.
  4. 라이선스(License)와 상업적 활용 가능 범위를 법무 관점에서 확인한다.
  5. 업데이트 주기와 커뮤니티 유지보수 상태를 점검해 장기 운영 리스크를 평가한다.

저자 의견으로는, 단순 리더보드 점수만으로 도입을 결정하기보다 운영 워크로드(workload)와 유사한 샘플로 자체 파일럿(pilot)을 수행한 뒤 결정하는 것이 리스크를 줄이는 길로 판단된다.

결론: 정확도와 처리량을 함께 보는 문서 OCR 선택 프레임

Datalab Marker 2가 olmOCR-bench에서 76.0점을 기록하고 MinerU 대비 약 5배의 처리량을 달성한 사례는, 오픈소스 문서 파싱 도구 선택의 평가축을 정확도 단일에서 정확도와 처리량으로 확장했음을 보여준다. 한국어·다국어 문서가 혼합된 실무 환경에서는 레이아웃 복잡도와 문서 양, 운영비 목표에 따라 4종 프로젝트를 조합해 도입하는 전략이 유효할 것으로 분석된다. 향후에는 동일 벤치마크 위에서 한국어 전용 평가 데이터셋을 추가하고, 한국어 RAG 파이프라인에서 청크 품질과 응답 지연을 함께 측정하는 평가 체계가 정착될 필요가 있다.

핵심 정리

  • olmOCR-bench 76.0점과 5배 처리량은 Marker 2의 정확도·처리량 동시 우위를 보여주는 대표 지표다.
  • 문서 파싱 도구 선정 시 정확도 단일이 아닌 정확도×처리량×운영비의 다축 평가가 필요하다.
  • 한국어·다국어 환경에서는 자체 파일럿 데이터로 레이아웃·표·수식 정확도를 검증해야 안정적인 도입이 가능하다.
  • RAG·에이전트 파이프라인에서는 파싱 품질이 인덱싱과 응답 지연 양쪽에 영향을 미친다.
  • 오픈소스 도구의 라이선스·업데이트 주기·커뮤니티 상태를 함께 점검하는 것이 장기 운영의 안전장치다.

관련 키워드: Datalab Marker 2, olmOCR-bench, MinerU, Docling, LiteParse, 오픈소스 OCR, 문서 파싱, 처리량 비교, RAG 파이프라인, AI 오픈소스, 다국어 문서 처리, 벤치마크 비교

참고 자료: MarkTechPost 기사 원문, olmOCR-bench 공개 리포지토리 및 리더보드

댓글 남기기