Traduction de documents numérisés

Dans un scan, le texte n'est pas du texte, c'est une image. Vous ne pouvez pas le sélectionner et les outils de traduction ordinaires ne peuvent pas le lire. C'est pourquoi le simple fait de glisser une archive photocopiée dans une zone de traduction ne donne généralement aucun résultat.

Geyi reconnaît ces fichiers avant de les traduire : le logiciel extrait les caractères de l'image, détermine l'ordre de lecture, puis traduit et remet en page le résultat. Les pages multi-colonnes sont restituées colonne par colonne plutôt que de manière désordonnée, et le texte vertical est converti en horizontal.

Quels originaux sont concernés

Quand la reconnaissance est-elle la plus précise

Une impression propre numérisée directement offre la meilleure précision. Les images floues, inclinées ou inégalement éclairées, ainsi que les pages contenant beaucoup d'écriture manuscrite, sont nettement plus difficiles à traiter. Pour ces cas, vérifiez les passages clés par rapport à l'original avant l'exportation.

Le japonais vertical, les doubles pages et autres ordres de lecture inhabituels sont corrigés automatiquement, sans qu'il soit nécessaire de diviser les pages ou de réorganiser quoi que ce soit vous-même.

Lorsque vous souhaitez uniquement le texte original

Si vous avez seulement besoin d'extraire le texte d'un scan sans le traduire, l'extraction de document est plus adaptée : elle est facturée 4 crédits par page et produit un document Word, PDF, TXT ou Markdown horizontal et modifiable, dans la langue de l'original.

Effectuer d'abord une extraction pour vérifier la qualité de la reconnaissance, puis décider de traduire ou non, est également un moyen d'économiser des crédits.

Résultats concrets

Quatre pages numérisées de japonais vertical issues de l'édition originale de 1917 de Rashōmon (kanji anciens, kana historiques, furigana) sont converties en chinois simplifié horizontal grâce à la traduction de fichiers avec une grande précision en mode reflow : le sens de lecture de droite à gauche est conservé, les furigana sont exclus du texte, les termes d'époque tels que l'avenue Suzaku, ichime-gasa et momi-eboshi sont préservés, et tout le corps du texte des 4 pages est traduit.

Une page de livre ancien numérisée : le titre vertical 羅生門 à droite et dix colonnes verticales de texte japonais à sa gauche, avec de petits furigana à côté des kanji et le numéro de page 1 en bas. Le début de la traduction : le titre en gras 罗生门 (羅生門) et deux paragraphes de chinois simplifié horizontal, commençant par la phrase sur un serviteur attendant que la pluie s'arrête sous la porte Rashōmon.
Page 1 de l'édition originale de 1917 du Rashōmon d'Akutagawa : une numérisation de texte vertical en kanji anciens avec des furigana à côté des caractères. À droite, le début de la traduction en chinois simplifié horizontal : le titre et les deux premiers paragraphes, dont le second se poursuit sur la page 2 du livre.
Quatre pages numérisées de japonais vertical sur deux rangées : page 1 en haut à droite, page 2 en haut à gauche, page 3 en bas à droite, page 4 en bas à gauche. Une page A4 de chinois simplifié horizontal intitulée 罗生门 (羅生門), avec six paragraphes de corps de texte.
Les 4 pages extraites (disposées de droite à gauche, de haut en bas, dans le sens de lecture japonais) à côté de la page traduite complète : tout le corps du texte des 4 pages est traduit dans l'ordre original sans aucun paragraphe manquant, et aucun furigana ne s'infiltre dans le texte.

Avant

或日の暮方の事である。一人の下人が、羅生門の下で雨やみを待つてゐた。廣い門の下には、この男の外に誰もゐない。唯、所々丹塗の剝げた、大きな圓柱に、蟋蟀が一匹とまつてゐる。羅生門が、朱雀大路にある以上は、この男の外にも、雨やみをする市女笠や揉烏帽子が、もう二三人はありさうなものである。それが、この男の外には誰もゐない。

Après

这是某日黄昏时分的事情。一个下人正在罗生门下等待雨停。宽阔的门下,除了这个男人以外谁也没有。只有在那几根各处剥落着朱红色油漆的大圆柱上,停着一只蟋蟀。既然罗生门位于朱雀大路上,除了这个男人之外,原本似乎还应有两三个戴着市女笠或揉乌帽子、在此躲雨的人。然而,除了这个男人以外,谁也没有。

Le passage d'ouverture : à gauche, le texte de la page 1 transcrit à partir de la numérisation avec ses kanji anciens et son orthographe kana historique (furigana omis) ; à droite, la traduction, non éditée.

Résultat de production réel ; 3 points corrigés manuellement avant affichage · Source : Rashōmon, Ryūnosuke Akutagawa, 1917 (L'auteur, Ryūnosuke Akutagawa, est décédé en 1927, il y a plus de 70 ans ; selon la loi japonaise sur le droit d'auteur, les œuvres des auteurs décédés avant la fin de 1967 étaient protégées pendant 50 ans après leur décès, la protection de ce livre a donc expiré à la fin de 1977. Les collections numériques de la Bibliothèque nationale de la Diète marquent cet élément PDM (Public Domain Mark) et le publient en ligne (DOI 10.11501/1088339).)

Questions fréquentes

Combien coûte la traduction d'un scan ?

Les scans suivent le parcours de reconnaissance utilisé par le document layout reflow : 8 crédits par page en haute précision, 4 en standard, avec un minimum de 10 crédits par fichier. Une seule image compte pour une page.

Pourquoi est-ce plus cher qu'un PDF normal ?

Un scan doit être reconnu avant de pouvoir être traduit, et cette étape consomme beaucoup plus de ressources de calcul que la lecture d'une couche de texte existante. Les PDF numériques en mode de préservation de la mise en page coûtent 4 crédits par page.

Les mises en page multi-colonnes sont-elles restituées de manière désordonnée ?

Non. Les pages multi-colonnes sont restaurées dans l'ordre de lecture plutôt que d'être balayées de gauche à droite en un seul bloc.

L'écriture manuscrite peut-elle être reconnue ?

Le texte imprimé est reconnu de manière beaucoup plus fiable que l'écriture manuscrite. Lorsqu'un document est en grande partie manuscrit, les résultats doivent être vérifiés — effectuez d'abord une extraction de document pour évaluer la qualité de la reconnaissance.

Quel est le format de la traduction finale ?

Les scans passent par le document layout reflow, vous pouvez donc exporter au format Word, PDF, Markdown ou EPUB. Notez que la traduction n'est pas réinsérée sur l'image originale ; elle est mise en page sous forme de document modifiable.

Une seule image coûte-t-elle vraiment 10 crédits ?

Oui — chaque fichier est facturé au minimum 10 crédits et une image compte pour une page. Combiner plusieurs images en un seul PDF avant l'importation permet de facturer sur le nombre total de pages, ce qui est plus économique.

Contenu associé

简体中文 · English · Deutsch · Русский · 日本語 · 한국어

Geyi is a proprietary AI document platform owned and operated by Nayuta Technology and Culture Company Limited.