縦書き日本語および古典的レイアウト

縦書きテキストは、一般的な翻訳ツールが最も苦手とする分野です。文字が上から下へ、右から左へと流れるため、横書きを前提とした読み取りを行うと、単語は認識できても文章全体が意味をなさない順序になってしまいます。

Geyiは縦書きレイアウトを専門的に処理します。縦書きの読み取り順序に従って認識を行い、見開きページや多段組みのページも自動的に修正し、横書きに変換された翻訳結果を出力します。

自動処理されるレイアウト

先に抽出するか、直接翻訳するか

古典的な文献から研究用に原文を抽出する必要がある場合は、ドキュメント抽出機能をご利用ください。1ページあたり4クレジットで、翻訳せずにWord、PDF、TXT、Markdown形式で抽出できます。

内容を読みたい場合は、AIリフローによるファイル翻訳を直接ご利用ください。認識と翻訳を一度に行います。認識精度が不安な場合は、まず1ページだけ抽出して確認するのが最も低コストな方法です。

古い資料における一般的な課題

再現性は品質に大きく影響します。直接スキャンした鮮明な印刷物は最も認識精度が高く、黄ばんだ紙、インクの裏写り、スキャンの歪みなどは認識を困難にします。異体字や古字は現代の字体に正規化される場合があります。

文献学的な研究においては、翻訳を読解の補助として活用し、重要な結論は原文から導き出すようにしてください。

処理結果の例

1917年版『羅生門』(旧字体、歴史的仮名遣い、ルビ付き)の縦書きスキャン4ページ分を、Geyiのファイル翻訳機能(リフローモード)で高精度に横書きの簡体字中国語へ変換しました。右から左への読み順を維持し、ルビを本文から除外。朱雀大路、一女笠、揉烏帽子といった時代用語もそのまま保持し、4ページ分の本文すべてを翻訳しています。

スキャンされた古い書籍のページ:右側に縦書きのタイトル「羅生門」、その左に10行の縦書き日本語テキスト。漢字の横に小さなルビがあり、下部にはページ番号「1」が記されています。 翻訳の冒頭部分:太字のタイトル「罗生门(羅生門)」と、横書き簡体字中国語の2段落。羅生門の下で雨宿りをする下人の様子を描写する文章から始まっています。
芥川龍之介『羅生門』1917年版初版の1ページ目:旧字体で書かれた縦書きテキストと、文字の横にルビが振られたスキャン画像。右側は横書き簡体字中国語への翻訳の冒頭部分。タイトルと最初の2段落が表示されており、2段落目は書籍の2ページ目へと続いています。
縦書き日本語のスキャン4ページ分を2列に配置:右上から1ページ目、左上から2ページ目、右下から3ページ目、左下から4ページ目。 横書き簡体字中国語のA4ページ1枚。「罗生门(羅生門)」というタイトルと、6段落の本文で構成されています。
抜粋した全4ページ(日本語の読み順に従い、右から左、上から下へ配置)と、翻訳後の全ページ:4ページ分の本文すべてが元の順序通りに翻訳されており、段落の欠落はなく、ルビが本文に混入することもありません。

処理前

或日の暮方の事である。一人の下人が、羅生門の下で雨やみを待つてゐた。廣い門の下には、この男の外に誰もゐない。唯、所々丹塗の剝げた、大きな圓柱に、蟋蟀が一匹とまつてゐる。羅生門が、朱雀大路にある以上は、この男の外にも、雨やみをする市女笠や揉烏帽子が、もう二三人はありさうなものである。それが、この男の外には誰もゐない。

処理後

这是某日黄昏时分的事情。一个下人正在罗生门下等待雨停。宽阔的门下,除了这个男人以外谁也没有。只有在那几根各处剥落着朱红色油漆的大圆柱上,停着一只蟋蟀。既然罗生门位于朱雀大路上,除了这个男人之外,原本似乎还应有两三个戴着市女笠或揉乌帽子、在此躲雨的人。然而,除了这个男人以外,谁也没有。

冒頭の文章:左はスキャンから書き起こした1ページ目のテキスト(旧字体、歴史的仮名遣い、ルビは省略)。右は未編集の翻訳テキスト。

実際の生成出力。表示前に3箇所を手動修正しています。 · 出典:羅生門, 芥川龍之介, 1917 (著者の芥川龍之介は1927年に没しており、70年以上が経過しています。日本の著作権法では、1967年末までに没した著者の著作物は死後50年で保護期間が満了するため、本書の保護期間は1977年末に終了しています。国立国会図書館デジタルコレクションでは、本資料はPDM(パブリックドメインマーク)として公開されています(DOI 10.11501/1088339)。)

よくある質問

縦書きのテキストがバラバラに出力されませんか?

いいえ。最初から縦書きの読み取り順序に従って認識を行い、見開きや多段組みのページも自動的に修正されるため、順序が乱れることはありません。

翻訳結果も縦書きになりますか?

いいえ。出力はすべて横書きになります。画面上での可読性が高く、翻訳後の編集も容易です。

料金体系はどうなっていますか?

縦書きの原稿は通常スキャン画像であるため、AIリフローの認識パスが適用されます。高精度設定で1ページあたり8クレジット、標準設定で4クレジットとなり、ファイルごとに最低10クレジットが必要です。

翻訳せずに原文だけを取得することはできますか?

はい。1ページあたり4クレジットのドキュメント抽出機能をご利用ください。翻訳を行わずにテキストを抽出します。

古字は認識されますか?

ほとんどの古字は認識されますが、現代の字体に正規化される場合があります。文献研究の場合は、原文を参照してください。

古典中国語のテキストにも対応していますか?

はい。縦書きの中国語は縦書きの日本語と同じ認識パスを通り、同様に読み取り順序の修正が行われます。

関連コンテンツ

简体中文 · English · Français · Deutsch · Русский · 한국어

Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.