OCR PDF (reconnaissance de texte)
Transforme un PDF scanné ou une photo en PDF interrogeable ou en texte.
Cet outil fonctionne avec JavaScript. Pour l’utiliser, activez JavaScript dans votre navigateur et rechargez la page.
PAGE SCANNÉE, TEXTE INTERROGEABLE.
OCR PDF lit l'écriture d'un PDF scanné ou de la photo d'un document et la convertit en texte. La reconnaissance se fait sur le serveur de RUPO avec le moteur open source Tesseract; le document n'est envoyé à aucun autre service. Chaque page du PDF est rendue à 300 dpi et lue une par une. Avec « PDF interrogeable », les pages restent identiques et une couche de texte invisible est ajoutée dessous : vous pouvez sélectionner et copier le texte et faire une recherche dans le document. « Texte brut (TXT) » donne seulement le texte reconnu; avec plusieurs pages, celles-ci sont séparées par des lignes numérotées.
« Langue du document » correspond par défaut à la langue de la page; si le document est dans une autre langue, choisissez-la dans la liste. Le turc, l'anglais, l'allemand, le français, l'espagnol, l'italien, le portugais, le japonais, le coréen, le hindi et l'arabe sont reconnus; les mots anglais sont en plus lus dans toutes les langues. La bonne langue compte pour que des lettres comme é, è, à et ç sortent correctement. Pour un PDF, le champ « Pages » permet de ne reconnaître que certaines pages (par exemple 1, 3-5); 200 pages au plus sont traitées à la fois. Les images JPG, PNG, WebP, TIFF et BMP peuvent aussi être envoyées. Vous pouvez envoyer jusqu'à 8 fichiers à la fois; tous sont traités avec les mêmes réglages et téléchargés dans un seul ZIP. L'écriture manuscrite et les images très floues ne sont pas reconnues.
Du début à la fin
- Envoyez votre document. Un PDF scanné ou une image JPG, PNG, WebP, TIFF ou BMP; jusqu'à 8 fichiers à la fois.
- Choisissez la sortie et la langue. PDF interrogeable ou texte brut. Si le document n'est pas dans la langue de la page, choisissez la bonne dans la liste « Langue du document ».
- Lancez la reconnaissance et téléchargez. La carte de résultat indique le nombre de pages et de caractères. Téléchargez; quand vous quittez l'outil, la copie sur le serveur est supprimée.
Questions fréquentes
Les accents sont-ils bien reconnus?
Oui. Avec la bonne langue du document, les lettres comme é, è, à, ç et œ sont lues correctement; sur une page en français, le français est déjà choisi par défaut. Si une mauvaise langue est choisie, ces lettres peuvent perdre leur accent; choisissez alors la bonne langue et réessayez.
Quelle différence entre un PDF interrogeable et du texte brut?
Dans un PDF interrogeable, la page reste telle qu'elle a été scannée; grâce à la couche de texte invisible, l'écriture peut être sélectionnée, copiée et recherchée. Le texte brut ne donne que l'écriture; la mise en forme, les images et la disposition des tableaux ne sont pas conservées. Si vous allez coller le texte ailleurs, choisissez TXT; si vous gardez le document pour y faire des recherches, choisissez le PDF interrogeable.
Que se passe-t-il avec un PDF qui contient déjà du texte?
Les pages sont tout de même relues à partir de l'image, et une note sur la carte de résultat l'indique. Pour obtenir le texte d'un tel PDF, l'OCR n'est pas nécessaire; « PDF → Word » l'extrait directement et plus vite.
Mon fichier reste-t-il sur le serveur?
Non. Votre fichier n’arrive sur le serveur que pour être traité et il est supprimé une fois l’opération terminée; le résultat est lui aussi supprimé dès que vous l’avez téléchargé et quitté l’outil. Aucun compte, nom ou adresse courriel n’est nécessaire, et vos fichiers ne sont jamais envoyés à un service tiers. L’utilisation est gratuite : aucun quota horaire ou journalier sur le nombre de traitements, aucune publicité à regarder avant le traitement et aucun filigrane ajouté au résultat.
Autres outils PDF
RUPO Studio