OCR de PDF (reconocimiento de texto)
Convierte un PDF escaneado o una foto en un PDF con búsqueda o en texto.
Esta herramienta funciona con JavaScript. Para usarla, activa JavaScript en tu navegador y recarga la página.
PÁGINA ESCANEADA, TEXTO CON BÚSQUEDA.
OCR de PDF lee lo escrito en un PDF escaneado o en la foto de un documento y lo convierte en texto. El reconocimiento se hace en el servidor de RUPO con el motor de código abierto Tesseract; el documento no se envía a ningún otro servicio. Cada página del PDF se dibuja a 300 ppp y se lee una por una. Con «PDF con búsqueda» las páginas se ven exactamente igual y se añade debajo una capa de texto invisible: puedes seleccionar y copiar el texto y buscar en el documento. «Texto plano (TXT)» da solo el texto reconocido; con varias páginas, estas se separan con líneas numeradas.
«Idioma del documento» es por defecto el idioma de la página; si el documento está en otro idioma, elígelo en la lista. Se reconocen turco, inglés, alemán, francés, español, italiano, portugués, japonés, coreano, hindi y árabe; las palabras en inglés se leen además en todos los idiomas. El idioma correcto importa para que letras como ñ, á, é y ü salgan bien. En un PDF, el campo «Páginas» permite reconocer solo algunas páginas (por ejemplo 1, 3-5); se procesan como máximo 200 páginas a la vez. También se pueden subir imágenes JPG, PNG, WebP, TIFF y BMP. Puedes subir hasta 8 archivos a la vez; todos se procesan con los mismos ajustes y se descargan en un solo ZIP. La escritura a mano y las imágenes muy borrosas no se reconocen.
De principio a fin
- Sube tu documento. Un PDF escaneado o una imagen JPG, PNG, WebP, TIFF o BMP; hasta 8 archivos a la vez.
- Elige la salida y el idioma. PDF con búsqueda o texto plano. Si el documento no está en el idioma de la página, elige el correcto en la lista «Idioma del documento».
- Reconoce y descarga. La tarjeta de resultado muestra el número de páginas y de caracteres. Descarga; al salir de la herramienta, la copia del servidor se borra.
Preguntas frecuentes
¿Se reconocen bien la ñ y las tildes?
Sí. Con el idioma del documento correcto, letras como ñ, á, é, í, ó, ú y ü se leen bien; en una página en español, el español ya viene elegido por defecto. Si se elige un idioma equivocado, estas letras pueden salir sin tilde; entonces elige el idioma correcto y vuelve a intentarlo.
¿Qué diferencia hay entre un PDF con búsqueda y el texto plano?
En un PDF con búsqueda la página se ve tal como se escaneó; gracias a la capa de texto invisible, lo escrito se puede seleccionar, copiar y buscar. El texto plano da solo lo escrito; el formato, las imágenes y la disposición de las tablas no se conservan. Si vas a pegar el texto en otro sitio, elige TXT; si vas a guardar el documento y buscar en él, elige el PDF con búsqueda.
¿Qué pasa con un PDF que ya contiene texto?
Las páginas se vuelven a leer desde la imagen y una nota en la tarjeta de resultado lo indica. Para sacar el texto de un PDF así no hace falta OCR; «PDF → Word» lo extrae directamente y más rápido.
¿Mi archivo se queda en el servidor?
No. Tu archivo solo llega al servidor para procesarse y se elimina al terminar el trabajo; el resultado también se elimina cuando lo descargas y sales de la herramienta. No necesitas cuenta, nombre ni correo electrónico, y tus archivos nunca se envían a un servicio de terceros. El uso es gratuito: no ponemos ninguna cuota por hora ni por día al número de procesos, no te hacemos ver anuncios antes de procesar y no añadimos marca de agua al resultado.
Otras herramientas de PDF
RUPO Studio