Cómo reconocer texto en un PDF escaneado con OCR
En resumen: El OCR no cambia el aspecto de la página: sobre la imagen se coloca una capa de texto invisible, y la búsqueda y la copia empiezan a funcionar. Las páginas que ya tienen texto se saltan. El modo de calidad es en realidad una resolución de render: rápido da 100 DPI, preciso da 300.
Cluster
guía paso a paso
Instrucciones paso a paso para llevar una tarea PDF de la entrada a un resultado fiable.
Herramienta principal
PDF con OCR online
Abre la herramienta de este artículo y completa la operación en la localización actual.
Abrir herramientaTabla de contenidos
- Qué se añade realmente al archivo
- Las páginas que ya tienen texto se saltan
- Los tres modos de calidad son tres resoluciones
- El idioma: automático significa dos idiomas a la vez
- Cómo lanzar el reconocimiento
- El enderezado y lo que cuesta
- Lo que el reconocimiento no hace
- Dónde encaja el reconocimiento en la cadena de operaciones
Reconocimiento de texto en un PDF: qué le pasa a un escaneo
Un documento escaneado parece un documento y se lee como un documento, pero para cualquier programa es una imagen. No se puede buscar en él, no se puede copiar de él un número de contrato, y un formulario que comprueba si hay texto lo rechaza como archivo vacío.
El reconocimiento resuelve exactamente eso, y lo hace de un modo que conviene entender: no reescribe nada.
Qué se añade realmente al archivo
La imagen de la página queda intacta. Sobre ella se coloca una segunda capa: texto situado donde en la imagen están las letras correspondientes, y hecho invisible.
De ahí salen todas las propiedades del resultado. Visualmente el archivo no se distingue del original: el mismo papel, los mismos sellos, la misma inclinación si la había. Al mismo tiempo la búsqueda encuentra palabras, un doble clic selecciona una línea y la copia devuelve texto real.
El mismo hecho explica por qué el reconocimiento es seguro para documentos cuyo aspecto importa. Un contrato escaneado con firma sigue siendo, tras el OCR, el mismo escaneo con la misma firma; simplemente ahora se puede buscar en él.
Las páginas que ya tienen texto se saltan
Antes de procesar, cada página se comprueba en busca de una capa de texto, y las que la tienen no se reconocen en absoluto.
De ahí salen dos consecuencias prácticas.
Los documentos mixtos se tratan correctamente sin esfuerzo alguno. Si parte de un archivo se escribió en un editor y parte se pegó como escaneo, solo se reconoce la segunda parte. El texto escrito sigue siendo el original en lugar de sustituirse por una copia reconocida, lo cual importa: el texto original es exacto, el reconocido contiene errores.
Aplicar OCR a un PDF de texto corriente no hace casi nada y no estropea nada. Resulta cómodo cuando no se sabe si el documento delante es un escaneo: basta con pasarlo por la herramienta.
La misma lógica gobierna la duración. No depende del número de páginas del documento sino del número de páginas sin texto. Un informe de doscientas páginas con cinco escaneos pegados se procesa en el tiempo de cinco páginas.
Los tres modos de calidad son tres resoluciones
La elección de calidad controla una sola cosa: la resolución a la que se dibuja la página antes del reconocimiento.
| Modo | Resolución | Cuándo elegirlo |
|---|---|---|
| Rápido | 100 DPI | Letra grande y nítida, una comprobación rápida |
| Equilibrado | 150 DPI | Documentos corrientes, contratos, certificados |
| Preciso | 300 DPI | Letra pequeña, notas al pie, copias malas |
El modo por defecto es el rápido, y conviene recordarlo. Cien puntos por pulgada bastan para titulares y cuerpo de texto a doce puntos, pero las notas pequeñas, las cifras de las tablas y los sellos salen bastante peor con ese render.
La regla es simple: si el documento contiene algo que usted mismo lee entornando los ojos, elija el modo preciso. Es más lento, y evita hacer el trabajo dos veces.
El idioma: automático significa dos idiomas a la vez
Están disponibles el inglés y el ruso, además de un modo automático.
El modo automático no adivina el idioma. Reconoce el documento en ambos a la vez, lo que encaja con textos donde un idioma va salpicado de nombres, códigos y términos del otro. El precio es la velocidad y una pequeña pérdida de precisión en texto homogéneo.
Si el documento está entero en un idioma, elegir ese idioma da un resultado algo mejor y más rápido.
Cuando el idioma elegido no está disponible, el reconocimiento no falla: se ejecuta con el instalado y adjunta un aviso aparte que nombra el idioma pedido y el aplicado. Ese aviso merece leerse en lugar de descartarse: un idioma sustituido en silencio explica un resultado extraño mejor que cualquier conjetura.
Una nota sobre documentos en otros idiomas. El alfabeto latino lo reconoce el paquete inglés, pero los signos diacríticos se pierden o se deforman por el camino: los textos en francés o alemán salen legibles con errores en los acentos. Los sistemas de escritura distintos del latino y el cirílico no están admitidos en absoluto.
Cómo lanzar el reconocimiento
1. Abra ocr-pdf y suba el documento. 2. Elija el idioma. Automático para texto mixto, un idioma concreto para texto homogéneo. 3. Ponga el modo preciso si el documento contiene letra pequeña. 4. Ejecute la tarea y descargue el resultado. 5. Abra el archivo y busque una palabra que sepa que está en el escaneo. Es la comprobación más rápida posible.
El enderezado y lo que cuesta
Un interruptor aparte endereza las páginas inclinadas antes del reconocimiento. Viene desactivado, y hay un motivo.
El enderezado se aplica a una copia temporal de la página, que es la que lee el reconocimiento, y la capa de texto se coloca después sobre la página original sin corregir. En un escaneo muy inclinado eso produce un desplazamiento: el texto invisible queda girado respecto a las letras visibles.
La búsqueda no se resiente, la palabra se encuentra igual. La selección con el ratón sí: el recuadro de selección cae lejos de las letras y copiar un fragmento se vuelve incómodo.
El compromiso es deliberado, porque las páginas originales quedan intactas. Si la inclinación es fuerte, lo mejor es enderezar el documento antes del reconocimiento, con rotate-pdf para giros en ángulo recto o rehaciendo el escaneo con scan-to-pdf, que sí endereza de verdad.
Lo que el reconocimiento no hace
No mejora el original. Una foto movida, el reflejo de una lámpara cruzando un renglón, la sombra de una mano sobre media página: todo eso se queda, y el reconocimiento sobre ese punto da galimatías o lo salta.
No lee manuscrito. La herramienta está pensada para letra impresa.
No produce texto con valor legal. La capa reconocida contiene errores y no sirve como copia del documento. Existe para buscar y para sistemas que exigen una capa de texto, no para citar.
Y no restaura resolución. Si el escaneo de origen se hizo a 75 puntos por pulgada, el modo preciso lo dibuja a 300, pero no aparecen letras nuevas: una imagen borrosa simplemente se agranda. La calidad del reconocimiento la fija el original, no el ajuste.
Dónde encaja el reconocimiento en la cadena de operaciones
El orden importa más de lo que parece, y hay una regla: el reconocimiento va antes de la compresión.
El reconocimiento trabaja sobre la imagen de la página. La compresión con compress-pdf degrada esa imagen: baja la resolución y añade artefactos alrededor de las letras. El orden inverso produce bastantes más errores en el texto, y después no queda con qué corregirlos.
El montaje y los giros también van antes del reconocimiento: cambian qué páginas existen y cómo están orientadas, y la capa de texto está atada a una página concreta.
Si lo que necesita no es un archivo con capa de texto sino el texto en sí como archivo aparte, para eso está pdf-to-text: extrae el contenido a un archivo de texto plano separado por páginas.
FAQ
Más de este cluster
guía paso a paso
Cómo pasar un PDF a Word editable
¿El archivo se abrió en Word pero el cursor no entra en el texto? Por qué de fábrica sale una imagen, en qué se diferencia el modo fluido del exacto y adónde fueron a parar los encabezados.
guía paso a paso
Cómo extraer tablas de PDF a Excel
De PDF a Excel: qué hojas acaban en el libro descargado, en qué se diferencian en la práctica los tres modos de detección y por qué el modo flexible encuentra más tablas pero rompe las palabras.
guía paso a paso
Extraer páginas de un PDF a otro archivo
Sacar de un PDF las hojas que necesitas como archivo aparte: en qué se diferencian los dos modos de salida, por qué los archivos del ZIP conservan los números de página originales y qué hace desactivar la conservación del tamaño.
Herramientas relacionadas
PDF con OCR online
PDF con OCR mantiene la tarea PDF en un solo flujo del navegador: subir el archivo, revisar opciones, procesar y descargar el resultado.
PDF a texto en línea
Extrae texto de un PDF a un archivo de texto plano para copiar el contenido sin formato ni diseño.
Comprimir PDF en línea
Reduce el tamaño de un PDF para enviarlo, subirlo o guardarlo con más facilidad. Es especialmente útil para escaneos y documentos con imágenes.
Girar PDF en línea
Corrige la orientación de páginas PDF si un escaneo o algunas hojas quedaron de lado o al revés.
Qué hacer después
Todas las herramientas
Catálogo de herramientas PDF: unir, comprimir, dividir, convertir, girar, proteger y desbloquear archivos PDF en línea.
FAQ
Respuestas a las preguntas más frecuentes sobre iHatePDF: si hace falta registrarse, cómo se procesan los archivos, dónde ver los límites y si es seguro cargar documentos.
Contacto
Contacta con iHatePDF por errores de procesamiento, elección de herramienta, seguridad, consultas comerciales y propuestas de nuevas funciones.