OCR PDF (riconoscimento testo)
Trasforma un PDF scansionato o una foto in un PDF ricercabile o in testo.
Questo strumento funziona con JavaScript. Per usarlo, attiva JavaScript nel browser e ricarica la pagina.
PAGINA SCANSIONATA, TESTO RICERCABILE.
OCR PDF legge la scrittura di un PDF scansionato o della foto di un documento e la trasforma in testo. Il riconoscimento avviene sul server di RUPO con il motore open source Tesseract; il documento non viene inviato a nessun altro servizio. Ogni pagina del PDF viene disegnata a 300 dpi e letta una per una. Con «PDF ricercabile» le pagine restano identiche e sotto viene aggiunto un livello di testo invisibile: puoi selezionare e copiare il testo e cercare nel documento. «Testo semplice (TXT)» dà solo il testo riconosciuto; con più pagine, queste sono separate da righe numerate.
«Lingua del documento» è per impostazione predefinita la lingua della pagina; se il documento è in un'altra lingua, sceglila dall'elenco. Vengono riconosciuti turco, inglese, tedesco, francese, spagnolo, italiano, portoghese, giapponese, coreano, hindi e arabo; le parole inglesi vengono lette in più in ogni lingua. La lingua giusta conta perché lettere come à, è, é, ì, ò e ù escano corrette. In un PDF, il campo «Pagine» permette di riconoscere solo alcune pagine (per esempio 1, 3-5); si elaborano al massimo 200 pagine alla volta. Si possono caricare anche immagini JPG, PNG, WebP, TIFF e BMP. Puoi caricare fino a 8 file alla volta; tutti vengono elaborati con le stesse impostazioni e scaricati in un unico ZIP. La scrittura a mano e le immagini molto sfocate non vengono riconosciute.
Dall’inizio alla fine
- Carica il tuo documento. Un PDF scansionato o un'immagine JPG, PNG, WebP, TIFF o BMP; fino a 8 file alla volta.
- Scegli uscita e lingua. PDF ricercabile o testo semplice. Se il documento non è nella lingua della pagina, scegli quella giusta dall'elenco «Lingua del documento».
- Avvia e scarica. La scheda del risultato mostra il numero di pagine e di caratteri. Scarica; quando esci dallo strumento, la copia sul server viene cancellata.
Domande frequenti
Le lettere accentate escono giuste?
Sì. Con la lingua del documento giusta, lettere come à, è, é, ì, ò e ù vengono lette correttamente; su una pagina in italiano, l'italiano è già scelto per impostazione predefinita. Se si sceglie la lingua sbagliata, queste lettere possono perdere l'accento; scegli allora la lingua giusta e riprova.
Che differenza c'è tra PDF ricercabile e testo semplice?
Nel PDF ricercabile la pagina appare esattamente come è stata scansionata; grazie al livello di testo invisibile, la scrittura si può selezionare, copiare e cercare. Il testo semplice dà solo la scrittura; formattazione, immagini e disposizione delle tabelle non vengono mantenute. Se incollerai il testo altrove, scegli TXT; se conserverai il documento per cercarci dentro, scegli il PDF ricercabile.
Cosa succede con un PDF che contiene già testo?
Le pagine vengono comunque rilette dall'immagine e una nota sulla scheda del risultato lo segnala. Per ottenere il testo di un PDF così non serve l'OCR; «PDF → Word» lo estrae direttamente ed è più veloce.
Il mio file resta sul server?
No. Il tuo file arriva sul server solo per essere elaborato e viene eliminato a lavoro finito; anche il risultato viene eliminato quando lo scarichi ed esci dallo strumento. Non servono account, nome o indirizzo email, e i tuoi file non vengono mai inviati a servizi di terze parti. L’uso è gratuito: nessuna quota oraria o giornaliera sul numero di operazioni, nessuna pubblicità da guardare prima dell’elaborazione e nessuna filigrana aggiunta al risultato.
Altri strumenti PDF
RUPO Studio