Como reconhecer texto em PDF digitalizado
Em resumo: O OCR não muda a aparência da página: sobre a imagem entra uma camada de texto invisível, e busca e cópia passam a funcionar. Páginas que já têm texto são puladas. O modo de qualidade é na verdade uma resolução de renderização: rápido dá 100 DPI, preciso dá 300.
Cluster
guia passo a passo
Instruções passo a passo para levar uma tarefa PDF da entrada a um resultado confiável.
Ferramenta principal
OCR de PDF online
Abra a ferramenta deste artigo e conclua a operação na localização atual.
Abrir ferramentaÍndice
- O que de fato é acrescentado ao arquivo
- Páginas que já têm texto são puladas
- Os três modos de qualidade são três resoluções
- Idioma: automático significa dois idiomas ao mesmo tempo
- Como rodar o reconhecimento
- O endireitamento e o que ele custa
- O que o reconhecimento não faz
- Onde o reconhecimento entra na cadeia de operações
Reconhecimento de texto em PDF: o que acontece com uma digitalização
Um documento digitalizado parece um documento e se lê como um documento, mas para qualquer programa é uma imagem. Não dá para buscar nele, não dá para copiar dele um número de contrato, e um formulário que confere a existência de texto o recusa como arquivo vazio.
O reconhecimento resolve exatamente isso, e de um jeito que vale entender: ele não reescreve nada.
O que de fato é acrescentado ao arquivo
A imagem da página fica intocada. Sobre ela entra uma segunda camada: texto posicionado onde na imagem estão as letras correspondentes, e tornado invisível.
Daí vêm todas as propriedades do resultado. Visualmente o arquivo não se distingue do original: o mesmo papel, os mesmos carimbos, a mesma inclinação, se houvesse. Ao mesmo tempo a busca acha palavras, um duplo clique seleciona uma linha e a cópia entrega texto de verdade.
O mesmo fato explica por que o reconhecimento é seguro para documentos em que a aparência importa. Um contrato digitalizado com assinatura continua, depois do OCR, a mesma digitalização com a mesma assinatura; apenas passou a ser pesquisável.
Páginas que já têm texto são puladas
Antes do processamento cada página é conferida em busca de camada de texto, e as que a têm não são reconhecidas de forma alguma.
Duas consequências práticas decorrem disso.
Documentos mistos são tratados corretamente sem esforço nenhum. Se parte de um arquivo foi digitada num editor e parte colada como digitalização, só a segunda parte é reconhecida. O texto digitado continua sendo o original em vez de ser trocado por uma cópia reconhecida, e isso importa: texto original é exato, texto reconhecido contém erros.
Rodar OCR num PDF de texto comum não faz quase nada e não estraga nada. É cômodo quando não se sabe se o documento à frente é uma digitalização: basta passá-lo pela ferramenta.
A mesma lógica governa a duração. Ela não depende do número de páginas do documento, e sim do número de páginas sem texto. Um relatório de duzentas páginas com cinco digitalizações coladas é processado no tempo de cinco páginas.
Os três modos de qualidade são três resoluções
A escolha da qualidade controla uma única grandeza: com que resolução a página é desenhada antes do reconhecimento.
| Modo | Resolução | Quando escolher |
|---|---|---|
| Rápido | 100 DPI | Letra grande e nítida, conferência de rascunho |
| Equilibrado | 150 DPI | Documentos comuns, contratos, certidões |
| Preciso | 300 DPI | Letra miúda, notas de rodapé, cópias ruins |
O padrão é o modo rápido, e vale lembrar disso. Cem pontos por polegada bastam para títulos e corpo de texto em doze pontos, mas notas pequenas, números em tabelas e carimbos saem bem piores nessa renderização.
A regra é simples: se o documento tem algo que você mesmo lê apertando os olhos, escolha o modo preciso. Ele é mais lento e poupa refazer o trabalho.
Idioma: automático significa dois idiomas ao mesmo tempo
Estão disponíveis inglês e russo, além de um modo automático.
O modo automático não adivinha o idioma. Ele reconhece o documento nos dois de uma vez, o que serve a textos em que um idioma vem salpicado de nomes, códigos e termos do outro. O preço é velocidade e uma pequena perda de precisão em texto homogêneo.
Se o documento estiver todo num idioma, escolher esse idioma dá um resultado um pouco melhor e mais rápido.
Quando o idioma escolhido não está disponível, o reconhecimento não falha: roda com o instalado e anexa um aviso próprio, nomeando o idioma pedido e o aplicado. Esse aviso merece ser lido em vez de fechado: um idioma trocado em silêncio explica um resultado estranho melhor do que qualquer palpite.
Uma observação sobre documentos em outros idiomas. O alfabeto latino é reconhecido pelo pacote inglês, mas os sinais diacríticos se perdem ou se deformam no caminho: textos em francês e alemão saem legíveis, com erros nos acentos. Sistemas de escrita fora do latino e do cirílico não são suportados de forma alguma.
Como rodar o reconhecimento
1. Abra o ocr-pdf e envie o documento. 2. Escolha o idioma. Automático para texto misturado, um idioma específico para texto homogêneo. 3. Ponha o modo preciso se o documento tiver letra miúda. 4. Execute e baixe o resultado. 5. Abra o arquivo e busque uma palavra que você sabe estar na digitalização. É a conferência mais rápida possível.
O endireitamento e o que ele custa
Uma chave à parte endireita páginas inclinadas antes do reconhecimento. Ela vem desligada, e há um motivo.
O endireitamento é aplicado a uma cópia temporária da página, que é o que o reconhecimento lê, e a camada de texto é então posta sobre a página original, não corrigida. Numa digitalização muito inclinada isso produz um deslocamento: o texto invisível fica girado em relação às letras visíveis.
A busca não sofre com isso, a palavra é achada assim mesmo. A seleção com o mouse sofre: o retângulo de seleção cai longe das letras e copiar um trecho fica desconfortável.
O compromisso é proposital, porque as páginas originais ficam intocadas. Se a inclinação for forte, o certo é endireitar o documento antes do reconhecimento, com o rotate-pdf para giros em ângulo reto ou refazendo a digitalização pelo scan-to-pdf, que endireita de verdade.
O que o reconhecimento não faz
Ele não melhora o original. Uma foto tremida, o reflexo de uma lâmpada atravessando uma linha, a sombra de uma mão sobre meia página: tudo isso fica, e o reconhecimento naquele ponto entrega bobagem ou pula o trecho.
Ele não lê manuscrito. A ferramenta é feita para letra impressa.
Ele não produz texto com valor jurídico. A camada reconhecida contém erros e não serve como cópia do documento. Ela existe para busca e para sistemas que exigem camada de texto, não para citar.
E ele não recupera resolução. Se a digitalização de origem foi feita a 75 pontos por polegada, o modo preciso a desenha a 300, mas letras novas não aparecem: uma imagem borrada simplesmente fica maior. A qualidade do reconhecimento é definida pelo original, não pelo ajuste.
Onde o reconhecimento entra na cadeia de operações
A ordem importa mais do que parece, e há uma regra: reconhecimento antes de compressão.
O reconhecimento trabalha sobre a imagem da página. A compressão pelo compress-pdf degrada justamente essa imagem: baixa a resolução e acrescenta artefatos ao redor das letras. A ordem inversa produz bem mais erros no texto, e depois não sobra com o que corrigir.
Montagem e giros também vêm antes do reconhecimento: eles mudam quais páginas existem e como estão orientadas, e a camada de texto está presa a uma página específica.
Se o que você precisa não é um arquivo com camada de texto, e sim o texto em si num arquivo à parte, existe o pdf-to-text: ele extrai o conteúdo para um arquivo de texto simples separado por páginas.
FAQ
Mais deste cluster
guia passo a passo
Como converter PDF em Word editável
O arquivo abriu no Word mas o cursor não entra no texto? Por que o padrão entrega uma imagem, em que o modo contínuo difere do exato e para onde foram os cabeçalhos.
guia passo a passo
Extrair tabelas de PDF para Excel
De PDF para Excel: quais planilhas acabam na pasta baixada, em que os três modos de detecção diferem na prática e por que o modo flexível acha mais tabelas mas parte as palavras.
guia passo a passo
Como extrair páginas de um PDF
Tirar de um PDF as folhas necessárias como arquivo separado: em que os dois modos de saída diferem, por que os arquivos do ZIP guardam os números de página originais e o que faz desligar a preservação do tamanho.
Ferramentas relacionadas
OCR de PDF online
OCR de PDF mantém a tarefa PDF em um único fluxo do navegador: enviar o arquivo, revisar opções, processar e baixar o resultado.
PDF para texto online
Extraia texto de um PDF para um arquivo de texto simples para copiar o conteúdo sem formatação e layout.
Compactar PDF online
Reduza o tamanho de um PDF para enviar, subir ou armazenar com mais facilidade. Especialmente útil para digitalizações e documentos com imagens.
Girar PDF online
Corrija a orientação de páginas PDF quando uma digitalização ou algumas folhas ficarem de lado ou de cabeça para baixo.
O que fazer em seguida
Todas as ferramentas
Catálogo de ferramentas PDF: juntar, compactar, dividir, converter, girar, proteger e desbloquear PDFs online.
FAQ
Respostas para as perguntas mais frequentes sobre o iHatePDF: é preciso se cadastrar, como os arquivos são processados, onde ver os limites e se é seguro enviar documentos.
Contato
Entre em contato com o iHatePDF sobre erros de processamento, escolha de ferramenta, segurança, propostas comerciais e sugestões de novas funcionalidades.