ドキュメント抽出

スキャンされた書籍、コピーされたアーカイブ、縦書きのページなど、画像化されたドキュメントがあります。抽出機能はこれらを読み取り、検索や編集が可能なテキストと構造を返します。

縦書きの日本語や中国語は横書きに変換され、複数段組みのページもバラバラのブロックではなく、読み取り順序に従って出力されます。

利用シーン

フォーマット変換を行うかどうかの境界線は、テキストが画像内にロックされているかどうかです。スキャンデータ、写真、古い縦書きの書籍などは、まず文字を認識する必要があるため、この機能が適しています。すでにデジタル化されており、テキストを選択できるようなクリーンなドキュメントで、拡張子のみが異なる場合は、より高速なフォーマット変換をご利用ください。どちらも1ページあたり4クレジットですが、カウント方法が異なります。ドキュメント抽出は元のファイルのページ数をカウントし、フォーマット変換は変換後のファイル全体の文字数をカウントします(1,600文字ごとに1ページとし、端数は切り捨て、最低1ページ分を課金)。同じPDFでも、1ページあたりの平均文字数が1,600文字未満の複数ページファイルは変換コストが低くなりますが、1ページあたりの平均が1,600文字を超える場合や、1ページのみの場合は、変換しても安くなりません。

抽出のみで翻訳は行われません。入力された言語がそのまま出力されます。翻訳が必要な場合は、ファイル翻訳をご利用ください。

対応フォーマットと出力形式

PDF、画像(PNG / JPG / WEBP / TIFFなど)、DOCX、EPUB、Markdownに対応しており、Word、PDF、TXT、Markdownで出力可能です。料金はページ単位で、1ページあたり4クレジットです。画像1枚は1ページとしてカウントされます。

バックグラウンドジョブとして実行されるため、ページを閉じて後から「履歴」で結果を確認できます。完了したジョブはオンラインでプレビュー可能です。

抽出精度が高くなる条件

4つの出力形式の選び方

出力形式推奨される用途
Word継続して編集やフォーマット調整を行う場合、または他者に渡す場合。
Markdownノートアプリやナレッジベース、または独自の執筆環境に取り込む場合。
TXT他のツールへの入力や、検索用のプレーンテキストが必要な場合。
PDF閲覧やアーカイブのみを目的とする場合。

処理結果の例

1913年米国国勢調査抄録の2ページのスキャン画像(2段組みテキストと統計表、テキストレイヤーなし)が、Document Extractionによって編集可能なテキストに変換されます。本文と太字のランイン見出しが正確に認識され、2レベルのヘッダーを持つ表を含む両方の表が、元のセルと一致する数値を持つ30行のデータ行を備えた実際の表として復元されます(脚注を含む)。

1913年米国国勢調査抄録の437ページのスキャン画像:上部に2段組みのテキスト、中央に表1とラベル付けされた統計表、その下に2段組みの定義がある黄ばんだ紙面。 抽出されたMarkdownのレンダリング結果:見出し「GENERAL SUMMARY.」、太字のランイン見出しを含む本文の段落、および「Total」、「Continental United States」、「Alaska」、「Hawaii」、「Porto Rico」の各列を持つデータ表。
1913年米国国勢調査抄録の437ページ(テキストレイヤーのないスキャン画像):本文と太字のランイン見出しが正確に認識され、表1は15行5列の編集可能な表となり、75個の数値が元のセルと一致しています。
438ページのスキャン画像:上部に2段組みのリード文、中央に表2の比較表(1909年、1904年、1899年の数値と2つの増加率の列)、その下に2段組みのテキスト。 抽出されたMarkdownのレンダリング結果:リード文の段落、データ表としての表2(1909年、1904年、1899年と2つの増加率の列)、脚注、およびその後に続く本文の段落。
438ページ:2レベルのヘッダー(「Number or Amount」および「Per Cent of Increase」、それぞれ年ごとに分割)を持つ1899〜1909年の比較表が、2行のヘッダーと元のセルと一致する数値を持つ編集可能な表になります。脚注マーカー(1)と脚注「Figures not available.」も保持されています。

実際の生成出力。表示前に5箇所を手動で修正済み。 · 出典:1910年米国第13回国勢調査:国勢調査抄録, 米国国勢調査局, 1913 (米国政府の著作物:米国国勢調査局が編集し、1913年に政府印刷局から出版されたため、合衆国法典第17編第105条に基づき著作権の対象外です。Internet Archiveのアイテム(カリフォルニア大学図書館がスキャン)は、possible-copyright-status = NOT_IN_COPYRIGHTとマークされています。)

よくある質問

縦書きの日本語は正しい順序に戻りますか?

はい。縦書きの日本語、見開きページ、その他の特殊な読み取り順序は自動的に修正され、横書きに変換されます。手動でページを分割する必要はありません。複数段組みのページもバラバラのブロックではなく、読み取り順序に従って出力されます。

料金体系はどのようになっていますか?

ページ単位です。1ページあたり4クレジットで、画像1枚は1ページとしてカウントされます。

抽出したテキストを翻訳できますか?

このページではできません。翻訳が必要な場合は、抽出したWordまたはMarkdownファイルをファイル翻訳にアップロードして実行してください。

関連コンテンツ

简体中文 · English · Français · Deutsch · Русский · 한국어

Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.