OCR de PDF (reconhecimento de texto)
Transforma um PDF digitalizado ou uma foto em PDF pesquisável ou em texto.
Esta ferramenta funciona com JavaScript. Para usá-la, ative o JavaScript no navegador e recarregue a página.
PÁGINA DIGITALIZADA, TEXTO PESQUISÁVEL.
O OCR de PDF lê o que está escrito em um PDF digitalizado ou na foto de um documento e transforma em texto. O reconhecimento é feito no servidor da RUPO com o motor de código aberto Tesseract; o documento não é enviado a nenhum outro serviço. Cada página do PDF é desenhada em 300 dpi e lida uma a uma. Com «PDF pesquisável» as páginas ficam exatamente iguais e uma camada de texto invisível é colocada por baixo: você pode selecionar e copiar o texto e pesquisar no documento. «Texto simples (TXT)» traz só o texto reconhecido; com várias páginas, elas são separadas por linhas numeradas.
«Idioma do documento» é, por padrão, o idioma da página; se o documento estiver em outro idioma, escolha-o na lista. São reconhecidos turco, inglês, alemão, francês, espanhol, italiano, português, japonês, coreano, hindi e árabe; palavras em inglês também são lidas em qualquer idioma. O idioma certo importa para que letras como ã, é, ç e ô saiam corretas. Em um PDF, o campo «Páginas» permite reconhecer só algumas páginas (por exemplo 1, 3-5); no máximo 200 páginas são processadas por vez. Também dá para enviar imagens JPG, PNG, WebP, TIFF e BMP. Você pode enviar até 8 arquivos de uma vez; todos são processados com as mesmas configurações e baixados em um único ZIP. Letra manuscrita e imagens muito borradas não são reconhecidas.
Do início ao fim
- Envie seu documento. Um PDF digitalizado ou uma imagem JPG, PNG, WebP, TIFF ou BMP; até 8 arquivos de uma vez.
- Escolha a saída e o idioma. PDF pesquisável ou texto simples. Se o documento não estiver no idioma da página, escolha o certo na lista «Idioma do documento».
- Reconheça e baixe. O cartão de resultado mostra o número de páginas e de caracteres. Baixe; ao sair da ferramenta, a cópia no servidor é apagada.
Perguntas frequentes
Acentos e cedilha saem certos?
Sim. Com o idioma do documento certo, letras como ã, õ, é, ê e ç são lidas corretamente; em uma página em português, o português já vem escolhido por padrão. Se o idioma errado for escolhido, essas letras podem sair sem acento; então escolha o idioma certo e tente de novo.
Qual a diferença entre PDF pesquisável e texto simples?
No PDF pesquisável a página aparece exatamente como foi digitalizada; graças à camada de texto invisível, o que está escrito pode ser selecionado, copiado e pesquisado. O texto simples traz só o que está escrito; formatação, imagens e o arranjo das tabelas não são mantidos. Se você vai colar o texto em outro lugar, escolha TXT; se vai guardar o documento e pesquisar nele, escolha o PDF pesquisável.
O que acontece com um PDF que já tem texto?
As páginas são lidas de novo a partir da imagem, e uma nota no cartão de resultado avisa isso. Para tirar o texto de um PDF assim não é preciso OCR; «PDF → Word» extrai o texto diretamente e é mais rápido.
O meu arquivo fica no servidor?
Não. O arquivo chega ao servidor apenas para ser processado e é excluído quando o trabalho termina; o resultado também é excluído depois de baixado, ao sair da ferramenta. Não é preciso conta, nome nem e-mail, e os seus arquivos nunca são enviados a serviços de terceiros. O uso é gratuito: não há cota por hora nem por dia para o número de operações, não é preciso assistir a anúncios antes do processamento e não adicionamos marca d’água ao resultado.
Mais ferramentas de PDF
RUPO Studio