Перевод сканированных документов

В скане текст — это не текст, а изображение. Его нельзя выделить, и обычные инструменты перевода не могут его прочитать, поэтому при загрузке ксерокопии в окно перевода вы обычно не получаете никакого результата.

Geyi распознает такие файлы перед переводом: сервис извлекает символы из изображения, определяет порядок чтения, а затем переводит и заново верстает результат. Многоколоночные страницы возвращаются с сохранением колонок, а не в виде неразборчивого текста, а вертикальный текст преобразуется в горизонтальный.

Какие оригиналы подходят для этого

Когда распознавание наиболее точное

Чистые отпечатки, отсканированные напрямую, обеспечивают наивысшую точность. Размытые, перекошенные или неравномерно освещенные изображения, а также страницы с большим количеством рукописного текста распознаются значительно сложнее — для них перед экспортом сверяйте ключевые фрагменты с оригиналом.

Вертикальный японский текст, развороты на две страницы и другие необычные порядки чтения исправляются автоматически, без необходимости разделять страницы или менять их порядок вручную.

Если вам нужен только исходный текст

Если вам нужно только извлечь текст из скана без перевода, лучше подойдет извлечение документа: оно стоит 4 кредита за страницу и позволяет получить редактируемый текст в формате Word, PDF, TXT или Markdown на языке оригинала.

Извлечение текста для проверки качества распознавания перед принятием решения о переводе — это также способ сэкономить кредиты.

Примеры результатов

Четыре отсканированные страницы вертикального японского текста из первого издания «Расёмон» 1917 года (старая орфография кандзи, историческая кана, фуригана) преобразованы в горизонтальный упрощенный китайский язык с помощью функции перевода файлов Geyi с высокой точностью в режиме сохранения макета: направление чтения справа налево сохранено, фуригана не попадает в основной текст, термины того времени, такие как проспект Судзаку, итиме-гаса и моми-эбоси, сохранены, а весь основной текст на 4 страницах переведен.

Отсканированная страница старой книги: вертикальное название 羅生門 справа и десять вертикальных столбцов японского текста слева, с маленькой фуриганой рядом с кандзи и номером страницы 1 внизу. Начало перевода: жирный заголовок 罗生门 (羅生門) и два абзаца горизонтального упрощенного китайского текста, начинающиеся с предложения о слуге, ожидающем окончания дождя под воротами Расёмон.
Страница 1 первого издания «Расёмон» Акутагавы 1917 года: скан вертикального текста со старой орфографией кандзи и фуриганой рядом с иероглифами. Справа — начало перевода на горизонтальный упрощенный китайский язык: название и первые два абзаца, второй из которых переходит на страницу 2 книги.
Четыре отсканированные страницы вертикального японского текста в два ряда: страница 1 вверху справа, страница 2 вверху слева, страница 3 внизу справа, страница 4 внизу слева. Одна страница формата A4 с горизонтальным упрощенным китайским текстом под заголовком 罗生门 (羅生門), содержащая шесть абзацев основного текста.
Все 4 извлеченные страницы (расположены справа налево, сверху вниз, в порядке чтения японского языка) рядом с полной переведенной страницей: весь основной текст на 4 страницах переведен в исходном порядке без пропусков абзацев, фуригана не попадает в текст.

До

或日の暮方の事である。一人の下人が、羅生門の下で雨やみを待つてゐた。廣い門の下には、この男の外に誰もゐない。唯、所々丹塗の剝げた、大きな圓柱に、蟋蟀が一匹とまつてゐる。羅生門が、朱雀大路にある以上は、この男の外にも、雨やみをする市女笠や揉烏帽子が、もう二三人はありさうなものである。それが、この男の外には誰もゐない。

После

这是某日黄昏时分的事情。一个下人正在罗生门下等待雨停。宽阔的门下,除了这个男人以外谁也没有。只有在那几根各处剥落着朱红色油漆的大圆柱上,停着一只蟋蟀。既然罗生门位于朱雀大路上,除了这个男人之外,原本似乎还应有两三个戴着市女笠或揉乌帽子、在此躲雨的人。然而,除了这个男人以外,谁也没有。

Вступительный отрывок: слева — текст страницы 1, транскрибированный со скана со старой орфографией кандзи и историческим написанием каны (фуригана опущена); справа — перевод без правок.

Фактический результат работы; 3 места исправлены вручную перед отображением · Источник: Расёмон, Рюноскэ Акутагава, 1917 (Автор, Рюноскэ Акутагава, скончался в 1927 году, более 70 лет назад. Согласно японскому законодательству об авторском праве, произведения авторов, умерших до конца 1967 года, охранялись в течение 50 лет после смерти, поэтому срок охраны этой книги истек в конце 1977 года. Цифровые коллекции Национальной парламентской библиотеки помечают этот объект как PDM (Public Domain Mark) и публикуют его онлайн (DOI 10.11501/1088339).)

Частые вопросы

Сколько стоит перевод скана?

Сканы проходят через процесс распознавания, используемый при рефлоу с помощью ИИ: 8 кредитов за страницу при высокой точности, 4 — при стандартной, с минимальной оплатой 10 кредитов за файл. Одно изображение считается за одну страницу.

Почему это дороже, чем обычный PDF?

Скан необходимо распознать перед переводом, и этот этап требует значительно больше вычислительных ресурсов, чем чтение существующего текстового слоя. Цифровые PDF-файлы в режиме сохранения макета стоят 4 кредита за страницу.

Не перемешивается ли верстка многоколоночных документов?

Нет. Многоколоночные страницы восстанавливаются в порядке чтения, а не объединяются в один блок слева направо.

Можно ли распознать рукописный текст?

Печатный текст распознается гораздо надежнее, чем рукописный. Если документ по большей части написан от руки, результаты требуют проверки — сначала запустите извлечение документа, чтобы оценить качество распознавания.

В каком формате будет готовый перевод?

Сканы проходят через рефлоу с помощью ИИ, поэтому вы можете экспортировать результат в Word, PDF, Markdown или EPUB. Обратите внимание, что перевод не накладывается поверх исходного изображения; он верстается как редактируемый документ.

Действительно ли одно изображение стоит 10 кредитов?

Да — каждый файл стоит минимум 10 кредитов, и одно изображение считается за одну страницу. Объединение нескольких изображений в один PDF-файл перед загрузкой позволяет оплачивать общее количество страниц, что выходит дешевле.

Похожие материалы

简体中文 · English · Français · Deutsch · 日本語 · 한국어

Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.