PDF to Markdown 변환기
Markdown은 PDF를 메모 앱, 지식 베이스, Git 저장소 또는 언어 모델용 코퍼스로 가져오기에 가장 쉬운 형식입니다. 일반 텍스트로 구성되어 구조가 명확하고 어디서나 열 수 있기 때문입니다. 문제는 PDF가 각 문자가 그려진 위치만 기록할 뿐 어떤 줄이 제목인지, 어떤 블록이 표인지 알 수 없다는 점입니다. 그래서 텍스트를 복사하면 줄이 깨지고 표가 흩어집니다.
Geyi는 모든 페이지에 대해 텍스트 인식 및 레이아웃 분석을 수행하여 제목, 단락, 목록, 표, 수식 및 그림을 식별한 다음 표준 Markdown(GFM) 파일로 작성합니다. 번역 없이 변환만 수행하므로 출력물은 원본 언어 그대로 유지됩니다.
활용 분야
- 메모 앱이나 지식 베이스로 가져가는 논문, 강의 노트 및 보고서(제목 수준이 개요가 됩니다).
- 버전 관리 하에 유지하기 위해 Git 저장소나 문서 사이트로 옮기는 제품 매뉴얼 및 기술 문서.
- 언어 모델이나 검색 시스템을 위한 자료: Markdown은 레이아웃 노이즈 없이 구조를 유지하므로 원시 텍스트보다 더 효과적으로 청킹(chunking)됩니다.
- 스캔 자료 디지털화: 모든 페이지가 텍스트 인식 과정을 거치므로 스캔본이나 사진으로 만든 PDF도 편집 가능한 텍스트로 변환됩니다.
유지되는 요소
- 제목 수준: 인식된 제목은 원래 계층 구조에 따라 # 마커로 변환되며, 수준 2(##)부터 시작합니다. 파일 최상단의 수준 1 제목은 .pdf 확장자를 제외한 업로드된 파일 이름입니다.
- 단락 및 목록: 순서가 있는 목록과 없는 목록은 들여쓰기가 유지됩니다. 굵게, 기울임꼴, 아래첨자, 위첨자, 취소선 및 링크는 원본과 동일하게 마크업됩니다.
- 표: Markdown 표로 작성됩니다. Markdown에는 셀 병합 기능이 없으므로 병합된 셀은 분할되고 나머지 셀은 비워집니다.
- 수식: LaTeX로 인식되어 인라인은 $…$로, 별도 줄은 $$…$$로 작성됩니다.
- 이미지: 그림은 .md 파일 내에 포함되므로 이미지 폴더 없이 파일 하나로 이동 가능합니다. 캡션은 각 이미지 아래에 위치합니다.
- 각주 및 코드: 각주는 텍스트와 일치하는 번호로 끝부분에 모아지며, 코드 블록은 그대로 유지됩니다.
청구 방식
페이지당 4 크레딧이 차감되며, 성공적으로 변환된 후에만 청구됩니다. 페이지 수는 생성된 텍스트를 기준으로 계산되며, 1,600자마다 1페이지로 간주하고 최소 1페이지부터 계산합니다.
시작 전, PDF의 페이지 수를 기준으로 예상 크레딧이 산정됩니다. 잔액이 부족할 경우 사전에 안내하며 변환이 시작되지 않습니다.
변환, 번역, 추출 중 선택하기
언어 변경 없이 형식만 바꾸려면 이 페이지를 사용하세요. 번역이 필요한 경우 Markdown으로도 내보낼 수 있는 파일 번역 기능을 사용하세요.
세로쓰기 도서나 읽기 순서가 일반적이지 않은 페이지의 경우 문서 추출 기능을 사용하세요. 세로쓰기 및 읽기 순서에 최적화되어 있으며 Markdown으로도 내보낼 수 있습니다.
세 단계로 PDF를 Markdown으로 변환하기
- PDF 업로드 이 페이지나 형식 변환 워크벤치에 PDF를 드래그 앤 드롭하세요. 여러 파일을 한 번에 올릴 수 있습니다.
- 대상 형식으로 Markdown 확인 대상 형식으로 Markdown을 선택하고(이 페이지에서 이동하면 미리 선택되어 있습니다) 변환을 시작하세요.
- .md 파일 다운로드 변환이 완료되면 결과를 다운로드하세요. 이미지가 포함된 .md 파일 하나가 생성됩니다. 일괄 다운로드 기능을 사용하면 여러 파일을 한꺼번에 받을 수 있습니다.
실제 결과
PDF에서 마크다운으로 변환된 NASA 기술 핸드북 2페이지: 3개의 번호가 매겨진 섹션 제목이 레벨별 마크다운 헤딩으로 변환되었으며, 본문은 원본과 단어 하나하나 일치하고 두 표 모두 마크다운 표로 변환되었습니다.
실제 제작 결과물이며, 표시 전 14곳을 수작업으로 교정하였습니다. · 출처: NASA 시스템 엔지니어를 위한 확장 지침, 제1권: 시스템 엔지니어링 관행, 스티븐 R. 허숀 (NASA 본부), 2016 (미국 정부 저작물: NASA 본부 직원이 저술한 NASA 특별 간행물 NASA/SP-2016-6105/SUPPL로, 17 U.S.C. §105에 따라 미국 내 저작권 대상이 아님. NASA 기술 보고서 서버(NTRS) 기록은 저작권 결정 GOV_PUBLIC_USE_PERMITTED 및 배포 PUBLIC으로 명시함.)
자주 묻는 질문
PDF를 Markdown으로 변환하는 비용은 얼마인가요?
페이지당 4 크레딧이 차감되며, 성공적으로 변환된 후에만 청구됩니다. 페이지 수는 생성된 텍스트를 기준으로 계산되며, 1,600자마다 1페이지로 간주하고 최소 1페이지부터 계산합니다. PDF의 페이지 수를 기준으로 예상 크레딧이 산정되므로 잔액이 부족하면 시작 전에 알림이 표시됩니다.
스캔한 PDF도 변환할 수 있나요?
네, 가능합니다. 모든 페이지는 텍스트 인식 과정을 거치므로 스캔본이나 사진으로 만든 PDF도 텍스트로 변환됩니다. 세로쓰기 도서나 읽기 순서가 일반적이지 않은 페이지는 문서 추출 기능을 사용하세요.
이미지는 어디에 포함되나요?
그림은 .md 파일 내부에 포함되므로 별도의 이미지 폴더가 필요 없으며 파일 하나로 모든 것이 해결됩니다. 캡션은 각 이미지 아래에 유지됩니다. 이미지가 많은 문서는 그만큼 파일 크기가 커집니다.
수식은 유지되나요?
네, 유지됩니다. 수식은 LaTeX로 인식되어 인라인은 $…$, 별도 줄은 $$…$$로 작성되며, 수식을 지원하는 Markdown 편집기에서 바로 표시됩니다.
표는 어떻게 처리되나요?
표준 Markdown 표로 변환됩니다. Markdown 표는 셀 병합을 지원하지 않으므로, 병합된 셀은 분할되고 추가 셀은 비워진 상태로 처리됩니다.
문서 번역도 함께 되나요?
아니요. 변환은 형식을 바꾸는 것이지 언어를 바꾸는 것이 아닙니다. 번역이 필요하면 파일 번역 기능을 사용하세요. Markdown으로도 내보낼 수 있습니다.
관련 콘텐츠
简体中文 · English · Français · Deutsch · Русский · 日本語
Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.