Конвертер PDF в Markdown
Markdown — самый удобный формат для переноса PDF в приложение для заметок, базу знаний, репозиторий Git или корпус для языковой модели: простой текст, четкая структура, открывается везде. Проблема в том, что PDF лишь фиксирует положение каждого символа, а не то, какая строка является заголовком или какой блок — таблицей, поэтому при копировании текста строки разрываются, а таблицы рассыпаются.
Geyi выполняет распознавание текста и анализ компоновки на каждой странице, определяет заголовки, абзацы, списки, таблицы, формулы и рисунки, а затем записывает их в один стандартный файл Markdown (GFM). Это только конвертация без перевода: результат остается на том же языке, что и оригинал.
Где это применимо
- Статьи, конспекты лекций и отчеты для заметок или базы знаний, где уровни заголовков становятся структурой документа.
- Руководства по продуктам и техническая документация для репозиториев Git или сайтов документации, которые должны поддерживаться под контролем версий.
- Материалы для языковой модели или поисковой системы: Markdown сохраняет структуру без лишнего визуального шума, поэтому он лучше разбивается на фрагменты, чем просто извлеченный текст.
- Оцифровка сканированных материалов: каждая страница проходит через распознавание текста, поэтому сканы и PDF, сделанные из фотографий, превращаются в редактируемый текст.
Что сохраняется
- Уровни заголовков: распознанные заголовки становятся маркерами # в своей иерархии, начиная со второго уровня (##); заголовок первого уровня в начале файла — это имя загруженного файла без расширения .pdf.
- Абзацы и списки: нумерованные и маркированные списки сохраняют вложенность; жирный шрифт, курсив, подстрочные и надстрочные знаки, зачеркивание и ссылки размечаются так же, как в оригинале.
- Таблицы: записываются как таблицы Markdown. В Markdown нет объединенных ячеек, поэтому они разделяются, а дополнительные ячейки остаются пустыми.
- Формулы: распознаются как LaTeX, записываются как $…$ внутри строки и $$…$$ на отдельной строке.
- Изображения: рисунки встраиваются непосредственно в файл .md, поэтому один файл можно перемещать без папки с изображениями; подписи располагаются под каждым изображением.
- Сноски и код: сноски собираются в конце с номерами, соответствующими тексту, а блоки кода остаются без изменений.
Как это оплачивается
4 кредита за страницу, списываются только после успешного преобразования. Страницы рассчитываются на основе созданного текста: каждые полные 1600 символов считаются страницей, минимум — одна страница.
Перед началом работы используется количество страниц PDF для оценки; если вашего баланса недостаточно, вы будете уведомлены заранее, и преобразование не начнется.
Выбор между преобразованием, переводом и извлечением
Используйте эту страницу для изменения формата без изменения языка. Для перевода используйте функцию перевода файлов, которая также позволяет экспортировать в Markdown.
Для книг с вертикальной версткой и страниц с необычным порядком чтения используйте извлечение документа: оно создано специально для вертикального текста и порядка чтения, а также экспортирует данные в Markdown.
Преобразование PDF в Markdown за три шага
- Загрузите PDF Перетащите PDF-файлы на эту страницу или в рабочую область преобразования форматов; можно загружать несколько файлов одновременно.
- Подтвердите Markdown в качестве целевого формата Выберите Markdown в качестве целевого формата (он выбран по умолчанию, если вы перешли с этой страницы), затем начните преобразование.
- Скачайте файл .md Скачайте результат после завершения: один файл .md со встроенными изображениями. Несколько файлов можно скачать вместе с помощью пакетной загрузки.
Примеры результатов
Две страницы технического руководства NASA, преобразованные из PDF в Markdown: три пронумерованных заголовка разделов стали заголовками Markdown по уровням, основной текст соответствует оригиналу слово в слово, обе таблицы стали таблицами Markdown.
Фактический результат работы; 14 мест исправлены вручную перед отображением · Источник: Расширенное руководство по системной инженерии NASA, том 1: Практика системной инженерии, Стивен Р. Хиршорн (штаб-квартира NASA), 2016 (Работа правительства США: специальная публикация NASA NASA/SP-2016-6105/SUPPL, подготовленная сотрудниками штаб-квартиры NASA, не подлежит защите авторским правом в Соединенных Штатах согласно 17 U.S.C. §105; запись на сервере технических отчетов NASA (NTRS) содержит определение авторского права GOV_PUBLIC_USE_PERMITTED и распространение PUBLIC.)
Частые вопросы
Сколько стоит преобразование PDF в Markdown?
4 кредита за страницу, списываются только после успешного преобразования. Страницы рассчитываются на основе созданного текста: каждые полные 1600 символов считаются страницей, минимум — одна страница; количество страниц в PDF дает предварительную оценку, поэтому при нехватке средств система предупредит вас до начала работы.
Можно ли преобразовывать отсканированные PDF-файлы?
Да. Каждая страница проходит через распознавание текста, поэтому сканы и PDF-файлы, созданные из фотографий, преобразуются в текст. Для книг с вертикальной версткой или страниц с необычным порядком чтения используйте извлечение документа.
Куда деваются изображения?
Изображения встраиваются непосредственно в файл .md, поэтому отдельной папки для них нет, и один файл содержит всё необходимое; подписи остаются под каждым изображением. Документы с большим количеством изображений создают соответствующие по размеру файлы.
Сохраняются ли формулы?
Да. Формулы распознаются как LaTeX, записываются как $…$ внутри строки и $$…$$ на отдельной строке и отображаются непосредственно в редакторах Markdown, поддерживающих математические формулы.
Что происходит с таблицами?
Они становятся стандартными таблицами Markdown. Таблицы Markdown не поддерживают объединение ячеек, поэтому объединенные ячейки разделяются, а дополнительные ячейки остаются пустыми.
Выполняется ли также перевод документа?
Нет. Преобразование меняет формат, а не язык. Для перевода используйте функцию перевода файлов; она также может экспортировать в Markdown.
Похожие материалы
简体中文 · English · Français · Deutsch · 日本語 · 한국어
Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.