PDFからMarkdownへの変換
Markdownは、PDFをメモアプリ、ナレッジベース、Gitリポジトリ、または言語モデル用のコーパスに取り込むための最も簡単な形式です。プレーンテキストで構造が明確であり、どこでも開くことができます。しかし、PDFは各文字が描画される位置を記録しているだけで、どの行が見出しで、どのブロックがテーブルであるかを認識していないため、テキストをコピーすると行が分断され、テーブルが崩れてしまいます。
Geyiは各ページでテキスト認識とレイアウト解析を行い、見出し、段落、リスト、テーブル、数式、図を特定し、標準的なMarkdown(GFM)ファイルとして書き出します。これは変換のみを行い、翻訳は行いません。出力は原文の言語のまま維持されます。
適した用途
- 論文、講義ノート、レポートをメモアプリやナレッジベースに取り込む場合。見出しレベルがアウトラインになります。
- 製品マニュアルや技術ドキュメントをGitリポジトリやドキュメントサイトに移行し、バージョン管理下で維持する場合。
- 言語モデルや検索システム用の素材:Markdownはレイアウトのノイズなしに構造を保持するため、生の抽出テキストよりも適切にチャンク化できます。
- スキャン素材のデジタル化:すべてのページがテキスト認識されるため、スキャンデータや写真から作成されたPDFも編集可能なテキストとして出力されます。
保持される要素
- 見出しレベル:認識された見出しは、元の階層に従って#マーカーになります(レベル2の##から開始)。ファイル最上部のレベル1見出しは、アップロードされたファイル名(.pdf拡張子なし)になります。
- 段落とリスト:順序付きリストと順序なしリストはネストが保持されます。太字、斜体、下付き文字、上付き文字、取り消し線、リンクは元の形式でマークアップされます。
- テーブル:Markdownテーブルとして書き出されます。Markdownには結合セルがないため、結合されたセルは分割され、余分なセルは空になります。
- 数式:LaTeXとして認識され、インラインは$…$、独立した行は$$…$$として書き出されます。
- 画像:図は.mdファイル自体に埋め込まれるため、画像フォルダなしで1つのファイルとして扱えます。キャプションは各画像の下に配置されます。
- 脚注とコード:脚注は末尾に番号順でまとめられ、コードブロックはそのまま保持されます。
課金について
1ページあたり4クレジット。変換が成功した場合のみ課金されます。ページ数は生成されたテキストに基づいて計算され、1,600文字ごとに1ページとみなされます(最低1ページ)。
開始前にPDFのページ数を使用して見積もりが算出されます。残高が不足している場合は事前に通知され、変換は開始されません。
変換、翻訳、抽出の使い分け
言語を変更せずにフォーマットのみを変更する場合は、このページを使用してください。翻訳が必要な場合は「ファイル翻訳」をご利用ください。こちらでもMarkdown形式でのエクスポートが可能です。
縦書きの書籍や特殊な読み順のページには「ドキュメント抽出」をご利用ください。縦書きテキストや読み順に最適化されており、Markdown形式でエクスポートできます。
PDFをMarkdownに変換する3つのステップ
- PDFをアップロード このページまたはフォーマット変換ワークベンチにPDFをドラッグ&ドロップしてください。複数ファイルを一度に処理できます。
- ターゲットとしてMarkdownを選択 ターゲットフォーマットとしてMarkdownを選択し(このページからアクセスした場合はあらかじめ選択されています)、変換を開始します。
- .mdファイルをダウンロード 完了したら結果をダウンロードしてください。画像が埋め込まれた1つの.mdファイルが生成されます。「一括ダウンロード」を使用すると、複数のファイルをまとめてダウンロードできます。
処理結果の例
NASA技術ハンドブックの2ページ分をPDFからMarkdownに変換:3つの番号付きセクションタイトルはMarkdownの見出しレベルに変換され、本文は元の単語と完全に一致し、2つの表はMarkdown形式の表になっています。
実際の生成出力。表示前に14箇所を手動修正しています。 · 出典:Expanded Guidance for NASA Systems Engineering, Volume 1: Systems Engineering Practices, Steven R. Hirshorn (NASA Headquarters), 2016 (米国政府の著作物:NASA本部スタッフが執筆したNASA特別出版物 NASA/SP-2016-6105/SUPPL であり、米国法典第17編第105条に基づき米国における著作権の対象外です。NASA技術レポートサーバー(NTRS)の記録では、著作権判定は「GOV_PUBLIC_USE_PERMITTED」、配布区分は「PUBLIC」とされています。)
よくある質問
PDFからMarkdownへの変換にはいくらかかりますか?
1ページあたり4クレジットで、変換が成功した場合のみ課金されます。ページ数は生成されたテキストに基づき、1,600文字ごとに1ページ(最低1ページ)として計算されます。PDFのページ数から事前見積もりが算出されるため、残高不足の場合は処理開始前に警告が表示されます。
スキャンされたPDFも変換できますか?
はい。すべてのページでテキスト認識が行われるため、スキャンデータや写真から作成されたPDFもテキストとして出力されます。縦書きの書籍や特殊な読み順のページには「ドキュメント抽出」をご利用ください。
画像はどこに保存されますか?
図版は.mdファイル自体に埋め込まれるため、個別の画像フォルダは作成されず、1つのファイルにすべてがまとめられます。キャプションは各画像の下に保持されます。画像が多いドキュメントほど、ファイルサイズも大きくなります。
数式は保持されますか?
はい。数式はLaTeXとして認識され、インラインの場合は$…$、独立した行の場合は$$…$$で記述されます。数式に対応したMarkdownエディタで直接表示可能です。
表はどうなりますか?
標準的なMarkdownの表に変換されます。Markdownの表はセルの結合に対応していないため、結合されていたセルは分割され、余分なセルは空欄になります。
ドキュメントの翻訳も同時に行われますか?
いいえ。変換はフォーマットを変更するものであり、言語は変更されません。翻訳が必要な場合は「ファイル翻訳」をご利用ください。こちらでもMarkdown形式でのエクスポートが可能です。
関連コンテンツ
简体中文 · English · Français · Deutsch · Русский · 한국어
Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.