Saltar al contenido
Artículo

Cómo reconocer texto en un PDF escaneado con OCR

El reconocimiento coloca una capa de texto invisible sobre la imagen intacta de la página. Por qué el modo predeterminado es el más rápido, qué hace el modo automático con el idioma y por qué el enderezado no viene activado.

En resumen: El OCR no cambia el aspecto de la página: sobre la imagen se coloca una capa de texto invisible, y la búsqueda y la copia empiezan a funcionar. Las páginas que ya tienen texto se saltan. El modo de calidad es en realidad una resolución de render: rápido da 100 DPI, preciso da 300.

Cluster

guía paso a paso

Instrucciones paso a paso para llevar una tarea PDF de la entrada a un resultado fiable.

13 artículos

Herramienta principal

PDF con OCR online

Abre la herramienta de este artículo y completa la operación en la localización actual.

Abrir herramienta

Tabla de contenidos

Reconocimiento de texto en un PDF: qué le pasa a un escaneo

Un documento escaneado parece un documento y se lee como un documento, pero para cualquier programa es una imagen. No se puede buscar en él, no se puede copiar de él un número de contrato, y un formulario que comprueba si hay texto lo rechaza como archivo vacío.

El reconocimiento resuelve exactamente eso, y lo hace de un modo que conviene entender: no reescribe nada.

Qué se añade realmente al archivo

La imagen de la página queda intacta. Sobre ella se coloca una segunda capa: texto situado donde en la imagen están las letras correspondientes, y hecho invisible.

De ahí salen todas las propiedades del resultado. Visualmente el archivo no se distingue del original: el mismo papel, los mismos sellos, la misma inclinación si la había. Al mismo tiempo la búsqueda encuentra palabras, un doble clic selecciona una línea y la copia devuelve texto real.

El mismo hecho explica por qué el reconocimiento es seguro para documentos cuyo aspecto importa. Un contrato escaneado con firma sigue siendo, tras el OCR, el mismo escaneo con la misma firma; simplemente ahora se puede buscar en él.

Las páginas que ya tienen texto se saltan

Antes de procesar, cada página se comprueba en busca de una capa de texto, y las que la tienen no se reconocen en absoluto.

De ahí salen dos consecuencias prácticas.

Los documentos mixtos se tratan correctamente sin esfuerzo alguno. Si parte de un archivo se escribió en un editor y parte se pegó como escaneo, solo se reconoce la segunda parte. El texto escrito sigue siendo el original en lugar de sustituirse por una copia reconocida, lo cual importa: el texto original es exacto, el reconocido contiene errores.

Aplicar OCR a un PDF de texto corriente no hace casi nada y no estropea nada. Resulta cómodo cuando no se sabe si el documento delante es un escaneo: basta con pasarlo por la herramienta.

La misma lógica gobierna la duración. No depende del número de páginas del documento sino del número de páginas sin texto. Un informe de doscientas páginas con cinco escaneos pegados se procesa en el tiempo de cinco páginas.

Los tres modos de calidad son tres resoluciones

La elección de calidad controla una sola cosa: la resolución a la que se dibuja la página antes del reconocimiento.

ModoResoluciónCuándo elegirlo
Rápido100 DPILetra grande y nítida, una comprobación rápida
Equilibrado150 DPIDocumentos corrientes, contratos, certificados
Preciso300 DPILetra pequeña, notas al pie, copias malas

El modo por defecto es el rápido, y conviene recordarlo. Cien puntos por pulgada bastan para titulares y cuerpo de texto a doce puntos, pero las notas pequeñas, las cifras de las tablas y los sellos salen bastante peor con ese render.

La regla es simple: si el documento contiene algo que usted mismo lee entornando los ojos, elija el modo preciso. Es más lento, y evita hacer el trabajo dos veces.

El idioma: automático significa dos idiomas a la vez

Están disponibles el inglés y el ruso, además de un modo automático.

El modo automático no adivina el idioma. Reconoce el documento en ambos a la vez, lo que encaja con textos donde un idioma va salpicado de nombres, códigos y términos del otro. El precio es la velocidad y una pequeña pérdida de precisión en texto homogéneo.

Si el documento está entero en un idioma, elegir ese idioma da un resultado algo mejor y más rápido.

Cuando el idioma elegido no está disponible, el reconocimiento no falla: se ejecuta con el instalado y adjunta un aviso aparte que nombra el idioma pedido y el aplicado. Ese aviso merece leerse en lugar de descartarse: un idioma sustituido en silencio explica un resultado extraño mejor que cualquier conjetura.

Una nota sobre documentos en otros idiomas. El alfabeto latino lo reconoce el paquete inglés, pero los signos diacríticos se pierden o se deforman por el camino: los textos en francés o alemán salen legibles con errores en los acentos. Los sistemas de escritura distintos del latino y el cirílico no están admitidos en absoluto.

Cómo lanzar el reconocimiento

1. Abra ocr-pdf y suba el documento. 2. Elija el idioma. Automático para texto mixto, un idioma concreto para texto homogéneo. 3. Ponga el modo preciso si el documento contiene letra pequeña. 4. Ejecute la tarea y descargue el resultado. 5. Abra el archivo y busque una palabra que sepa que está en el escaneo. Es la comprobación más rápida posible.

El enderezado y lo que cuesta

Un interruptor aparte endereza las páginas inclinadas antes del reconocimiento. Viene desactivado, y hay un motivo.

El enderezado se aplica a una copia temporal de la página, que es la que lee el reconocimiento, y la capa de texto se coloca después sobre la página original sin corregir. En un escaneo muy inclinado eso produce un desplazamiento: el texto invisible queda girado respecto a las letras visibles.

La búsqueda no se resiente, la palabra se encuentra igual. La selección con el ratón sí: el recuadro de selección cae lejos de las letras y copiar un fragmento se vuelve incómodo.

El compromiso es deliberado, porque las páginas originales quedan intactas. Si la inclinación es fuerte, lo mejor es enderezar el documento antes del reconocimiento, con rotate-pdf para giros en ángulo recto o rehaciendo el escaneo con scan-to-pdf, que sí endereza de verdad.

Lo que el reconocimiento no hace

No mejora el original. Una foto movida, el reflejo de una lámpara cruzando un renglón, la sombra de una mano sobre media página: todo eso se queda, y el reconocimiento sobre ese punto da galimatías o lo salta.

No lee manuscrito. La herramienta está pensada para letra impresa.

No produce texto con valor legal. La capa reconocida contiene errores y no sirve como copia del documento. Existe para buscar y para sistemas que exigen una capa de texto, no para citar.

Y no restaura resolución. Si el escaneo de origen se hizo a 75 puntos por pulgada, el modo preciso lo dibuja a 300, pero no aparecen letras nuevas: una imagen borrosa simplemente se agranda. La calidad del reconocimiento la fija el original, no el ajuste.

Dónde encaja el reconocimiento en la cadena de operaciones

El orden importa más de lo que parece, y hay una regla: el reconocimiento va antes de la compresión.

El reconocimiento trabaja sobre la imagen de la página. La compresión con compress-pdf degrada esa imagen: baja la resolución y añade artefactos alrededor de las letras. El orden inverso produce bastantes más errores en el texto, y después no queda con qué corregirlos.

El montaje y los giros también van antes del reconocimiento: cambian qué páginas existen y cómo están orientadas, y la capa de texto está atada a una página concreta.

Si lo que necesita no es un archivo con capa de texto sino el texto en sí como archivo aparte, para eso está pdf-to-text: extrae el contenido a un archivo de texto plano separado por páginas.

FAQ

No. La imagen de la página queda como estaba y encima se añade una capa de texto invisible. Visualmente el archivo no se distingue del original, mientras que buscar y copiar empiezan a funcionar.
Prácticamente nada: las páginas que ya tienen texto se saltan sin procesar. Resulta cómodo para documentos mixtos donde unas páginas están escritas y otras escaneadas.
Inglés y ruso. El modo automático reconoce ambos a la vez, lo que encaja con documentos de texto mezclado. Si el idioma elegido no está disponible, el reconocimiento se ejecuta con el que sí lo está y lo indica en un aviso aparte.
No, el flujo básico funciona sin registrarse.
Los archivos se usan solo para la operación elegida y se eliminan automáticamente al terminar el procesamiento. No usamos los documentos subidos para entrenar modelos de IA.

Más de este cluster

Herramientas relacionadas

← Todas las herramientas de Optimizar

Qué hacer después

Si después de leer necesitas el siguiente paso práctico o más contexto sobre el servicio, abre estas páginas.

Todas las herramientas

Catálogo de herramientas PDF: unir, comprimir, dividir, convertir, girar, proteger y desbloquear archivos PDF en línea.

FAQ

Respuestas a las preguntas más frecuentes sobre iHatePDF: si hace falta registrarse, cómo se procesan los archivos, dónde ver los límites y si es seguro cargar documentos.

Contacto

Contacta con iHatePDF por errores de procesamiento, elección de herramienta, seguridad, consultas comerciales y propuestas de nuevas funciones.