티스토리 뷰

 



문서 데이터 추출 도구, 흔히 말하는 '파서'를 탐색할 때, 아무래도 벤치마크를 참고하게 됩니다.
저희는 공개돼 있는 OCR·문서 파싱 리더보드 13개를 모아 하나의 표로 정리해봤어요. 그런 다음 흔히들 묻는 "어떤 파서가 제일 좋아요?"라는 질문 대신, 훨씬 더 단순한 질문을 하나 던져봤습니다.

벤치마크를 만든 조직이 자기네 모델을 직접 출전시키면, 그 모델은 대체 몇 등을 할까요?

 

저희가 모은 자료 중 열 개의 벤치마크에는 제작자나 후원사와 관련된 모델이 출전해 있었는데요, 놀랍게도 이 열 개 전부에서 그 관련 모델이 상위 3위 안에 들었습니다.
심지어 그중 일곱 개는 아예 1등을 차지했어요. 한결같은 '홈 어드밴티지'의 결과입니다. 

스코어보드

각 벤치마크의 대표 결과를 기준으로 '홈팀'들의 성적을 정리해보면 아래 표와 같습니다.

벤치마크소속·연관 관계연관 모델 성적

ParseBench LlamaParse 제작사인 LlamaIndex가 발행 1위, LlamaParse Agentic (84.88)
Nanonets IDP Leaderboard — 1위, Nanonets OCR-3 (85.9)
OpenDataLoader Bench OpenDataLoader가 발행 1위, opendataloader [hybrid] (0.907)
Unstructured SCORE Unstructured가 발행 1위, Adjusted CCT (0.880)
RealDocBench Extend가 발행 1위, Document QA (96.0%)
LongExtractionBench Reducto가 후원 1위, Reducto Deep Extract (99.6%)
MORE Tencent 소속 연구자들이 제작; HunyuanOCR 개발도 Tencent가 주도 1위, HunyuanOCR (92.42)
OmniDocBench MinerU 개발사인 OpenDataLab이 발행 2위, MinerU2.5-Pro (95.75)
olmOCR-Bench olmOCR 개발사인 Ai2가 발행 3위, olmOCR 2 (82.4)
MDPBench MonkeyOCRv2도 함께 개발한 연구진이 제작 3위, MonkeyOCRv2-B (83.3)

(2026년 9월 1일 기준)

이쯤 되면 냉소적으로 "문서 벤치마크는 다 짜고 치는 거 아니야?"라는 생각이 들 수도 있습니다. 그런데 사실 이런 쏠림 현상을 설명해주는, 이미 잘 알려진 메커니즘이 몇 가지 있습니다.

문제점 설정
팀들이 새로운 벤치마크를 만드는 이유는, 정확히 말하면 기존 평가 방식이 자기들이 중요하게 여기는 '문제점'을 놓치고 있기 때문이에요. 그리고 그들의 모델은 애초에 바로 그 케이스를 풀도록 만들어져 있죠. 실제로 LlamaParse 팀은 자체 벤치마크를 내놓기 전에, 가장 널리 쓰이던 OCR 파싱 벤치마크인 OmniDocBench와 olmOCR를 비판한 적이 있습니다.

설정값의 비대칭 
제작자는 자기 도구의 최적 설정을 훤히 알고 있지만, 경쟁 도구의 최적 설정까지 찾아줄 이유는 딱히 없죠. 상대 엔진은 기본값 그대로 돌리고 자기 엔진은 세심하게 튜닝한 값으로 돌리는 것을 사기라고까지 부를 순 없습니다. 그냥 경쟁사를 돋보이게 해줄 이유가 아무에게도 없을 때 자연스럽게 벌어지는 일일 뿐입니다.

성능 점검표의 역할
벤치마크가 한번 만들어지고 나면, 그 팀은 새 버전을 낼 때마다 알게 모르게 이 벤치마크로 점수를 확인하면서 제품을 다듬게 됩니다. 쉽게 말해 사내에서 매번 들여다보는 '성능 점검표'가 되는 셈이죠. 그러다 보니 버전을 거듭할수록 점점 그 벤치마크에 딱 맞게 최적화되는 반면, 경쟁사 모델들은 이런 사전 준비 없이 처음 마주하는 그대로 평가를 받게 됩니다.

발표 필터링
조직들은 자기네 연구나 제품의 핵심 가치를 입증해주는 결과가 아니면 잘 공개하지 않습니다. 홈팀이 진 벤치마크는 조용히 묻혀버립니다. 그러니 우리가 실제로 보게 되는 결과들은 상당 부분 생존자 편향으로 걸러진 셈이에요.

한마디로 정리하면, 벤치마크에는 그걸 만든 사람이 문제를 바라보는 방식이 그대로 담겨 있고, 제작자의 시스템은 바로 그 정의에 맞춰 체계적으로 설계돼 있습니다. 모두가 선의로 움직이더라도 이런 흐름은 자연스럽게 생길 수밖에 없습니다.

 

어웨이 게임

벤치마크끼리 비교해보면 점수가 얼마나 들쭉날쭉한지 알 수 있는데요, 버전에 따라서도 해석이 달라집니다. 

HunyuanOCR을 예로 들어볼게요. 기본 모델이 MORE에서는 92.42점(1위)을 받았는데, OmniDocBench에서는 89.95점(18위), MDPBench에서는 68.3점에 그쳤어요. 자기 안방 벤치마크에서는 압도적이지만, 다른 데이터셋으로 평가하면 성적이 뚝 떨어지는 거죠.

olmOCR 2도 마찬가지로 극명한 차이를 보여줍니다. Ai2가 발표한 olmOCR-Bench 성적은 82.4점(전체 3위)이었어요. 그런데 PDF Parse Bench의 표(table) 추출 항목에서는 olmOCR-2-7B가 3.51점에 그치면서, 22개 엔진 중 21위에 머물렀습니다.

이런 차이가 있다고 해서 어느 한쪽 벤치마크가 틀렸다는 뜻은 아닙니다. 그보다는 기준과 감점 방식이 애초에 전혀 다른 능력을 평가하고 있다는 의미죠. 정확도 점수는 모델에 고정적으로 붙어 다니면서 어디든 그대로 옮겨 적용할 수 있는 속성이 아니기 때문입니다.

그래서 리더보드를 읽을 때는 이런 방식을 추천드려요.

벤더가 만든 리더보드는 활용하되, '벤더 제품'만 빼고 보시면 돼요. 모델 제작자가 만든 리더보드라고 해서 가치가 없는 건 아닙니다. 이런 벤치마크를 만드는 데는 상당한 엔지니어링 노력이 들어가니까요. 문서를 고르고, 채점 기준을 정하고, 수십 개의 경쟁 엔진을 실제로 돌려보는 그 투자 덕분에 정말 쓸모 있는 데이터가 나오곤 합니다. 다만 딱 하나, 무시해야 할 행이 있다면, 바로 운영 주체 자신의 점수입니다!

그러니 홈팀 행만 지워버리면, 남는 건 나머지 모두를 대상으로 한, 자금과 관리가 탄탄하게 뒷받침된 순위표가 되는 거죠. 예를 들어 Ai2의 olmOCR-Bench는 olmOCR 자신에 대해서는 믿을 만한 심판이 아닐 수 있지만, 그 표에 오른 나머지 20여 개 엔진끼리 비교하는 데는 여전히 훌륭한 도구랍니다.

이 방식을 따르면 우리는 어떤 도구를 '홈 성적'이 아니라 '원정 성적'으로 평가하는 셈이 됩니다. 특정 모델을 판단하고 싶다면, 그 모델 제작자가 발표한 리더보드만 빼고 나머지 모든 곳에서의 점수를 찾아보는 게 훨씬 균형 잡힌 결과를 줍니다. 경쟁사 벤치마크에서도 버텨내는 모델이라면, 말하자면 '적대적 감사'를 통과한 셈이니까요. 다만 이 방식도 정반대의 편향을 끌어들일 수 있습니다. 경쟁사 역시 자기네 모델은 돋보이고 남의 모델은 어렵게 만드는 테스트를 설계할 유인이 있거든요. 그래서 가능하다면, 한계가 있더라도 독립적으로 운영되는 리더보드가 있을 경우 그게 가장 믿을 만한 기준이 될 수 있습니다.

만약 이파피루스도 언젠가 문서 파싱 벤치마크를 공개한다면, 저희 엔진 역시 상위권에 들게 될 것입니다. 저희가 도저히 못 넘어갈 만큼 신경 쓰이는 실패 유형을 중심으로 테스트를 설계하고, 그 분포에 맞춰 모델을 학습시키고, 바로 그 실수들을 고치는 데 몇 달을 쏟아부었을 테니까요. 다만 그 결과는 저희 제품이 저희 벤치마크와 잘 맞아떨어진다는 걸 보여줄 뿐이지, 저희가 "문서 파싱 문제를 다 풀었다"는 걸 증명해주는 건 아닙니다!

문서 AI 리더보드 사 가이드

벤치마크는 제 역할 범위 안에서 해석하는 한, 여전히 유용한 진단 도구예요.

  • 먼저 소속 관계부터 확인하세요.
    점수를 보기 전에 저자 명단과 기업 후원 관계부터 읽어보시고요. 운영 주체가 직접 출전시킨 항목이 있다면, 머릿속으로 그 행은 지워버리세요. 상용 도구라면 경쟁사 벤치마크에서, 가능하다면 독립적으로 운영되는 벤치마크에서 각각 어떤 성적을 내는지 확인해보세요.

  • 모든 상용 도구는 교차 검증해보세요.
    경쟁사 벤치마크에서, 그리고 되도록이면 독립적으로 운영되는 벤치마크에서 어떤 성적을 내는지 찾아보세요. 홈에서만 이기는 도구라면, 그 자체로 뭔가 인사이트를 얻을 수 있습니다.

  • 결국은 자신의 데이터로 평가해보세요.
    이게 공개된 그 어떤 벤치마크보다 낫습니다. 실제로 중요한 문제 정의는 바로 여러분이 가진 문서 집합이니까요. 시간은 좀 걸리겠지만, 실제 문서 소량 샘플만으로도 어떤 리더보드에서도 볼 수 없었던 실패 유형이 드러날 거예요.

내 데이터로 직접 평가하기

결국 자신의 문서로 직접 평가해봐야, 어떤 솔루션이 나에게 가장 좋은 결과를 주는지 알 수 있습니다. 먼저 여러분의 문서 집합에서 '문서 파싱이 성공했다'는 게 어떤 모습인지 정의해보시고, 그 정의에 맞춰 소규모 정답 데이터셋(ground truth)을 직접 손으로 만들어보시길 추천드려요.

이렇게 자신의 데이터를 기준으로 벤치마킹하면, 내 상황에 딱 맞는 만큼 가장 의미 있는 벤치마킹 결과를 얻을 수 있답니다.

그러니 벤치마크는 얼마든지 활용하시되, 신중하게 들여다 보셔야 합니다!

* 위 표에서 언급한 벤치마크들에 대해 더 자세히 알고 싶으시다면 아래 링크를 참고해주세요:

ParseBench

Nanonets IDP Leaderboard

OpenDataLoader Bench

Unstructured SCORE

RealDocBench

LongExtractionBench

MORE

OmniDocBench

olmOCR-Bench

MDPBench



 

🎉 Happy Coding! 🙂

CPU 기반의 데이터 추출 도구(파서) PyMuPDF에 대해 더 궁금하시다면, 이파피루스 홈페이지를 방문해주세요!

👉 문서 데이터 추출 파이썬 라이브러리 PyMuPDF Pro