표 추출, 이제 훨씬 정확하고 빨라집니다문서에서 데이터 뽑아보신 분들은 아실 텐데, 표(table)만큼 골치 아픈 게 없습니다. 셀은 삐뚤빼뚤하고, 병합된 셀도 있고, 줄바꿈까지 섞여 있으면 정말 답이 없거든요.PyMuPDF4LLM 1.28이 바로 이 문제를 정면으로 다뤘습니다. 기본값인 Layout 모듈에서 표 추출 기능이 대폭 개선됐습니다. 문서 인텔리전스 분야에서 손꼽히게 까다로운 문제인 만큼, 이번 업데이트는 꽤 의미가 큽니다.뭐가 바뀌었나요?PyMuPDF4LLM 1.28은 이제 이런 순서로 표를 처리합니다.표 바운딩 박스 감지 — 기존에도 하던 거지만, 정확도가 한층 올라갔습니다표 구조 감지 — 행 나누기, 열 나누기, 셀 그리드까지 다시 짜맞춥니다Layout 모듈 안에서 한 번에 처리 — 표 ..
ePapyrus는 법률, 금융, 의료, 공공, 물류 등 다양한 산업 군에서 연간 수백만 건의 문서를 처리하는 고객들과 함께 일하고 있습니다. 그런데 여러분, 이 정도 대규모 스케일의 조직에서 모든 페이지를 아무 생각 없이 OCR 엔진이나 LLM(대형 언어 모델)으로 그냥 밀어 넣으면 어떻게 될까요? 당연히 시간과 비용 면에서 비효율적일 수밖에 없습니다.그렇기 때문에 문서를 먼저 영리하게 분류하고 걸러내는 '사전 필터링' 작업이 반드시 필요합니다."이 페이지는 스캔한 이미지일까, 아니면 디지털 텍스트일까?""단순 서식 양식일까, 표가 빽빽한 보고서일까, 아니면 그냥 평범한 줄글일까?""애초에 비용을 써가며 처리할 만한 가치가 있는 페이지인가?""이 페이지에서 콘텐츠를 가장 효율적으로 뽑아내는 방법은 뭘까?..
안녕하세요, 이파피루스입니다.이번 포스팅은 PyMuPDF Layout을 사용하는 가장 기초적인 워크플로우를 설명합니다.Python과 커맨드라인 사용 경험, PyPI 패키지 설치 경험이 있으면 쉽게 따라올 수 있어요.1️⃣ 설치하기먼저 필요한 패키지를 설치합니다. 터미널에서 아래 명령어를 실행하세요:pip install pymupdf-layoutpip install pymupdf4llmPyMuPDF Layout은 레이아웃을 감지/분석하는 역할을 하고,PyMuPDF4LLM은 그 결과를 Markdown, JSON, 텍스트 같은 출력 형태로 변환하는 역할을 합니다.2️⃣ PyMuPDF Layout 주요 기능PyMuPDF Layout으로 할 수 있는 일은 크게 두 가지입니다:문서에서 구조화된 데이터(텍스트, 표,..
안녕하세요, 이파피루스입니다.이 포스팅에서는 DocLayNet 데이터셋에서 PyMuPDF-Layout을 Docling과 비교한 벤치마크 결과를 정리한 리포트를 소개해드립니다. IoU 기반 지표로 레이아웃 탐지 정확도를 비교하고, 모델 효율성(파라미터 수, GPU 의존성 등)도 함께 살펴봅니다.실험방법:데이터셋: DocLayNet (Pfitzmann et al., 2022)학습(Training) 세트: 69,000 페이지검증(Validation) 세트: 6,480 페이지문서 카테고리: 재무 보고서, 과학 논문, 특허, 매뉴얼, 법률 문서, 입찰 문서(tender documents)어노테이션 스키마: 11개 클래스 라벨(caption, footnote, formula, list-item, page-foote..
AI용 데이터 추출 어떻게 하고 계신가요?문서 포맷마다 다른 파싱 제품을 돌려가며 쓰고 계시진 않으신가요 PDF는 A 솔루션아래한글(HWP,HWPX)은 B 제품Word·Excel은 또 다른 프로그램 제각각 다른 문서 파싱 프로그램으로 추출된 데이터는 페이지 정보, 위치 정보가 일관되게 추출되지 않습니다.막상 추출한 데이터를 AI 서비스에 적용할 때 문제가 발생할 수 밖에 없습니다. AI 기반 문서 검색(Q&A), 요약, 분석 LLM 서비스를 구축해 놓았을 때,문서마다 다른 파서로 데이터를 추출했다면, 질의 응답의 근거가 되는 부분을 찾아내기가 어려워집니다. 추출 된 데이터의 좌표, 구조가 일관되지 않고 파서마다 달라질 확률이 있기 때문입니다.실제 업무에 활용할 수 있는 AI 질의 응답 서비스는“어떤 부..
Google이 최근 Gemini 3.0을 공개하면서 문서 AI 업계가 꽤 들썩이고 있습니다.멀티모달 성능이 좋아졌다는 얘기도 많고, 실제로 문서 처리 회사들 중 일부는 벌써 파싱 작업에 적용해서 필기체 인식이나 읽기 순서 감지 같은 부분의 개선을 확인했다고 합니다.하지만 초기 사용자들은 여전히 해결되지 않은 문제도 발견했습니다.복잡한 레이아웃에서는 성능이 떨어지고, 취소선 같은 텍스트 스타일을 제대로 못 잡는 경우가 많으며, 특정 텍스트 위치를 박스로 표시해 인용하는(bounding-box citation) 기능도 정확하지 않다는 점이죠.사실 이건 그렇게 놀라운 일도 아닙니다.PDF를 다룰 때 비전 기반 시스템은 근본적으로 넘어야 할 벽이 있어요.쉽게 말하면:애초에 문제 자체를 잘못 정의하고 있는 셈입니..
시작지난 9월, 유럽과 아시아에서 온 동료들이 샌프란시스코 본사에서 북쪽으로 110km 떨어진 작은 해안 마을에 모였습니다. 이파피루스와 이파피루스의 미국 자회사 Artifex 팀원들은 거의 모든 시간대에 흩어져 일하고 있거든요. 안개가 밀려오는 가운데, 우리는 일주일 내내 단 하나의 주제만 논의했습니다: 35년간 쌓아온 문서 처리 지식, 특히 PDF 같은 비정형 포맷 전문성을 최첨단 AI와 어떻게 결합해서 최고의 데이터 파싱 솔루션을 만들 수 있을까?이파피루스와 Artifex는 이미 PyMuPDF 제품군으로 인기 있는 파싱 솔루션을 제공하고 있습니다. 마크다운 출력에 특화된 PyMuPDF4LLM도 포함해서요. Notion, DocuSign, Oracle 같은 주요 고객들이 우리 솔루션을 쓰고 있지만, ..
PDF 텍스트 검색 및 치환: PyMuPDF Pro로 간단하게 해결하기PDF 편집은 오래전부터 개발자들에게 까다로운 작업이었지만, PyMuPDF Pro를 사용하면 훨씬 간단하게 처리할 수 있습니다.회사 이름을 업데이트하거나, 오타를 수정하거나, 여러 문서에 걸쳐 오래된 정보를 교체해야 할 때 PyMuPDF Pro는 강력한 검색 및 치환 기능을 제공합니다.PyMuPDF Pro란?PyMuPDF Pro는 MuPDF의 파이썬 바인딩으로, 가볍고 빠른 PDF 툴킷입니다.속도가 빠르고 메모리 효율이 뛰어나며, 텍스트 추출·렌더링·수정까지 다양한 기능을 제공합니다.특히 일부 라이브러리처럼 새 문서를 생성하지 않고, 기존 PDF의 구조와 포맷을 유지한 채 직접 수정할 수 있다는 장점이 있습니다.설치아래와 같이 pip으..
📄 PyMuPDF Pro를 활용한 PDF 표 추출: 실무 중심 활용 가이드오늘은 PyMuPDF Pro를 이용해 PDF 문서에서 표를 추출하는 과정을 살펴보고, 이를 다양한 실무 환경에서 어떻게 활용할 수 있는지에 대해 설명합니다.많은 PDF 문서(특히 스프레드시트나 데이터 내보내기 결과물에서 생성된 문서)는 **구조화된 표(table)**를 포함하고 있으며, 이를 가공 가능한 형식으로 변환하는 것이 중요합니다.이 글에서는 표 추출의 중요성과 대표적인 활용 사례, 그리고 PyMuPDF Pro의 향상된 기능(예: Markdown 변환, pandas DataFrame 내보내기 등)이 이 과정을 어떻게 지원하는지를 설명합니다.✅ 표 추출이 중요한 이유금융, 학계, 기업 환경 등에서 접하게 되는 많은 문서들은 ..
- Total
- Today
- Yesterday
- LLM
- 이벤트
- Ai
- 피터펜
- 페이퍼리스
- 파이썬라이브러리
- pdf뷰어
- 전자문서
- 데이터추출
- pdf추출
- 전자서식
- 스마트공장
- 이파피루스
- 피터팬
- 인공지능
- pdf프로
- PyMuPDFPro
- PDF변환
- 고장예측
- djvu
- PDF-Pro
- 문서ai
- 모터센스
- 예지보전
- PDF편집
- pdf프로그램
- ocr
- epapyrus
- PDFpro
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |