Перевод сканированных документов
В скане текст — это не текст, а изображение. Его нельзя выделить, и обычные инструменты перевода не могут его прочитать, поэтому при загрузке ксерокопии в окно перевода вы обычно не получаете никакого результата.
Geyi распознает такие файлы перед переводом: сервис извлекает символы из изображения, определяет порядок чтения, а затем переводит и заново верстает результат. Многоколоночные страницы возвращаются с сохранением колонок, а не в виде неразборчивого текста, а вертикальный текст преобразуется в горизонтальный.
Какие оригиналы подходят для этого
- Сканированные страницы книг и ксерокопии — PDF-файлы, полученные с помощью сканера или копировального аппарата.
- Фотографии документов — форматы PNG, JPEG, WEBP, TIFF и аналогичные графические форматы.
- PDF-файлы, состоящие только из изображений — те, в которых невозможно выделить текст в программе для чтения.
- Старые публикации со сложной версткой — несколько колонок, вертикальное письмо, развороты на две страницы.
Когда распознавание наиболее точное
Чистые отпечатки, отсканированные напрямую, обеспечивают наивысшую точность. Размытые, перекошенные или неравномерно освещенные изображения, а также страницы с большим количеством рукописного текста распознаются значительно сложнее — для них перед экспортом сверяйте ключевые фрагменты с оригиналом.
Вертикальный японский текст, развороты на две страницы и другие необычные порядки чтения исправляются автоматически, без необходимости разделять страницы или менять их порядок вручную.
Если вам нужен только исходный текст
Если вам нужно только извлечь текст из скана без перевода, лучше подойдет извлечение документа: оно стоит 4 кредита за страницу и позволяет получить редактируемый текст в формате Word, PDF, TXT или Markdown на языке оригинала.
Извлечение текста для проверки качества распознавания перед принятием решения о переводе — это также способ сэкономить кредиты.
Примеры результатов
Четыре отсканированные страницы вертикального японского текста из первого издания «Расёмон» 1917 года (старая орфография кандзи, историческая кана, фуригана) преобразованы в горизонтальный упрощенный китайский язык с помощью функции перевода файлов Geyi с высокой точностью в режиме сохранения макета: направление чтения справа налево сохранено, фуригана не попадает в основной текст, термины того времени, такие как проспект Судзаку, итиме-гаса и моми-эбоси, сохранены, а весь основной текст на 4 страницах переведен.
До
或日の暮方の事である。一人の下人が、羅生門の下で雨やみを待つてゐた。廣い門の下には、この男の外に誰もゐない。唯、所々丹塗の剝げた、大きな圓柱に、蟋蟀が一匹とまつてゐる。羅生門が、朱雀大路にある以上は、この男の外にも、雨やみをする市女笠や揉烏帽子が、もう二三人はありさうなものである。それが、この男の外には誰もゐない。
После
这是某日黄昏时分的事情。一个下人正在罗生门下等待雨停。宽阔的门下,除了这个男人以外谁也没有。只有在那几根各处剥落着朱红色油漆的大圆柱上,停着一只蟋蟀。既然罗生门位于朱雀大路上,除了这个男人之外,原本似乎还应有两三个戴着市女笠或揉乌帽子、在此躲雨的人。然而,除了这个男人以外,谁也没有。
Фактический результат работы; 3 места исправлены вручную перед отображением · Источник: Расёмон, Рюноскэ Акутагава, 1917 (Автор, Рюноскэ Акутагава, скончался в 1927 году, более 70 лет назад. Согласно японскому законодательству об авторском праве, произведения авторов, умерших до конца 1967 года, охранялись в течение 50 лет после смерти, поэтому срок охраны этой книги истек в конце 1977 года. Цифровые коллекции Национальной парламентской библиотеки помечают этот объект как PDM (Public Domain Mark) и публикуют его онлайн (DOI 10.11501/1088339).)
Частые вопросы
Сколько стоит перевод скана?
Сканы проходят через процесс распознавания, используемый при рефлоу с помощью ИИ: 8 кредитов за страницу при высокой точности, 4 — при стандартной, с минимальной оплатой 10 кредитов за файл. Одно изображение считается за одну страницу.
Почему это дороже, чем обычный PDF?
Скан необходимо распознать перед переводом, и этот этап требует значительно больше вычислительных ресурсов, чем чтение существующего текстового слоя. Цифровые PDF-файлы в режиме сохранения макета стоят 4 кредита за страницу.
Не перемешивается ли верстка многоколоночных документов?
Нет. Многоколоночные страницы восстанавливаются в порядке чтения, а не объединяются в один блок слева направо.
Можно ли распознать рукописный текст?
Печатный текст распознается гораздо надежнее, чем рукописный. Если документ по большей части написан от руки, результаты требуют проверки — сначала запустите извлечение документа, чтобы оценить качество распознавания.
В каком формате будет готовый перевод?
Сканы проходят через рефлоу с помощью ИИ, поэтому вы можете экспортировать результат в Word, PDF, Markdown или EPUB. Обратите внимание, что перевод не накладывается поверх исходного изображения; он верстается как редактируемый документ.
Действительно ли одно изображение стоит 10 кредитов?
Да — каждый файл стоит минимум 10 кредитов, и одно изображение считается за одну страницу. Объединение нескольких изображений в один PDF-файл перед загрузкой позволяет оплачивать общее количество страниц, что выходит дешевле.
Похожие материалы
- Перевод PDF
- Перевод текста с изображений
- Извлечение данных из документов
- Вертикальный японский текст и классические макеты
- Изучите пример перед использованием собственного документа
简体中文 · English · Français · Deutsch · 日本語 · 한국어
Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.