OCR de PDF (reconhecimento de texto)
Transforma um PDF digitalizado ou uma fotografia em PDF pesquisável ou em texto.
Esta ferramenta funciona com JavaScript. Para a usar, ative o JavaScript no navegador e recarregue a página.
PÁGINA DIGITALIZADA, TEXTO PESQUISÁVEL.
O OCR de PDF lê o que está escrito num PDF digitalizado ou na fotografia de um documento e converte-o em texto. O reconhecimento é feito no servidor da RUPO com o motor de código aberto Tesseract; o documento não é enviado para nenhum outro serviço. Cada página do PDF é desenhada a 300 dpi e lida uma a uma. Com «PDF pesquisável» as páginas ficam exatamente iguais e é colocada por baixo uma camada de texto invisível: pode selecionar e copiar o texto e pesquisar no documento. «Texto simples (TXT)» dá apenas o texto reconhecido; com várias páginas, estas são separadas por linhas numeradas.
«Idioma do documento» é, por predefinição, o idioma da página; se o documento estiver noutro idioma, escolha-o na lista. São reconhecidos turco, inglês, alemão, francês, espanhol, italiano, português, japonês, coreano, hindi e árabe; as palavras em inglês também são lidas em qualquer idioma. O idioma certo importa para que letras como ã, é, ç e ô saiam corretas. Num PDF, o campo «Páginas» permite reconhecer apenas algumas páginas (por exemplo 1, 3-5); são processadas no máximo 200 páginas de cada vez. Também é possível carregar imagens JPG, PNG, WebP, TIFF e BMP. Pode carregar até 8 ficheiros de uma vez; todos são processados com as mesmas definições e transferidos num único ZIP. A letra manuscrita e as imagens muito desfocadas não são reconhecidas.
Do início ao fim
- Carregue o seu documento. Um PDF digitalizado ou uma imagem JPG, PNG, WebP, TIFF ou BMP; até 8 ficheiros de uma vez.
- Escolha a saída e o idioma. PDF pesquisável ou texto simples. Se o documento não estiver no idioma da página, escolha o certo na lista «Idioma do documento».
- Reconheça e transfira. O cartão de resultado mostra o número de páginas e de caracteres. Transfira; ao sair da ferramenta, a cópia no servidor é apagada.
Perguntas frequentes
Os acentos e a cedilha saem corretos?
Sim. Com o idioma do documento certo, letras como ã, õ, é, ê e ç são lidas corretamente; numa página em português, o português já está escolhido por predefinição. Se for escolhido o idioma errado, estas letras podem sair sem acento; escolha então o idioma certo e tente novamente.
Qual a diferença entre PDF pesquisável e texto simples?
No PDF pesquisável a página aparece exatamente como foi digitalizada; graças à camada de texto invisível, o que está escrito pode ser selecionado, copiado e pesquisado. O texto simples dá apenas o que está escrito; a formatação, as imagens e a disposição das tabelas não são mantidas. Se vai colar o texto noutro sítio, escolha TXT; se vai guardar o documento e pesquisar nele, escolha o PDF pesquisável.
O que acontece com um PDF que já tem texto?
As páginas são lidas novamente a partir da imagem e uma nota no cartão de resultado indica-o. Para obter o texto de um PDF assim não é preciso OCR; «PDF → Word» extrai o texto diretamente e é mais rápido.
O meu ficheiro fica no servidor?
Não. O ficheiro chega ao servidor apenas para ser processado e é eliminado quando o trabalho termina; o resultado também é eliminado depois de transferido, ao sair da ferramenta. Não é preciso conta, nome nem e-mail, e os seus ficheiros nunca são enviados a serviços de terceiros. A utilização é gratuita: não há quota por hora nem por dia para o número de operações, não é preciso ver anúncios antes do processamento e não adicionamos marca de água ao resultado.
Mais ferramentas de PDF
RUPO Studio