Beta 서비스 오픈

PDF → 마크다운(Markdown) 고성능 변환기

2단 레이아웃, 복잡한 논문 표, 수식(LaTeX)까지 깨짐 없이 구조화된 마크다운으로 추출하는 최적의 PDF 파싱 솔루션입니다.

클릭하거나 파일을 이곳에 드롭하세요

지원 포맷: .pdf (최대 10MB)

💡 표준 디지털 텍스트 문서 변환을 지원합니다. (스캔 이미지 전용 문서는 텍스트 추출이 제한될 수 있습니다)

2단(Multi-column) 흐름 복원

논문이나 보고서의 2단/3단 텍스트 배치를 좌표 기반으로 분석하여 순서가 꼬이지 않는 단일 스트림 마크다운으로 복원합니다.

표(Table) 셀 데이터 파싱

기존 PDF 추출 도구에서 깨지는 선 없는 표, 병합 셀(Rowspan/Colspan)을 정확히 인식하여 표준 마크다운 표로 변환합니다.

LLM / RAG 데이터셋 최적화

불필요한 헤더/푸터 페이지 번호를 자동 제거하고, AI 모델 학습 및 백엔드 벡터 DB에 즉시 삽입 가능한 깨끗한 마크다운을 제공합니다.

PDF 파싱이 어려운 이유

PDF 포맷은 '어디에서든 동일하게 보이는 인쇄물'을 위해 설계되었기 때문에, 내부에 의미론적(Semantic) 구조 정보가 전혀 없습니다. PyPDF2나 pdfplumber 같은 전통적인 라이브러리는 화면의 좌표 순서대로 텍스트를 긁어모을 뿐이어서, 2단(Multi-column) 논문에서 양 단의 문장이 뒤섞이거나, 표의 셀 데이터가 무작위로 나열되는 현상이 발생합니다. 이 문제를 해결하기 위해 컴퓨터 비전(Vision) 기반의 레이아웃 분석과 고도화된 휴리스틱 알고리즘이 필요합니다.

MDChange 팀은 이 난제를 극복한 차세대 PDF 파싱 엔진을 탑재했습니다. 기술적 배경이 궁금하시다면 아래 블로그 포스트를 참고하세요.

📄 PDF 파싱의 악몽: 다단 레이아웃과 표 추출은 왜 이렇게 어려울까?
현재 제공 중인 HWP/HWPX 변환기 이용하기