Ir para o conteúdo
AZ Tools

Por que não dá para pesquisar no seu PDF

PDF não é um formato de texto que por acaso vem diagramado. É uma descrição de página: uma lista de instruções dizendo desenhe este glifo nesta posição, ou pinte esta imagem sobre este retângulo. Uma página feita num processador de texto desenha caracteres e pode ser pesquisada. Uma página feita por um scanner ou pela câmera do celular desenha uma única fotografia, e nada dentro do arquivo sabe o que essa fotografia diz.

Dois tipos de página idênticos na tela

Uma página de texto carrega fontes, códigos de caractere e coordenadas. Uma página digitalizada carrega uma imagem, normalmente a folha inteira, e nada além disso. As duas são desenhadas como uma página escrita e, no zoom normal, você não distingue uma da outra.

A diferença só aparece quando algo tenta ler a página em vez de desenhá-la: busca, seleção, cópia, um leitor de tela, um programa extraindo dados. Tudo isso precisa de caracteres, e numa página digitalizada não existe nenhum.

Como identificar em poucos segundos

Tente selecionar uma linha. Se o cursor desenha um retângulo sobre uma região em vez de destacar palavras, a página é uma imagem. Depois amplie bastante: o texto de verdade continua nítido em qualquer ampliação, porque é redesenhado a partir dos contornos da fonte, enquanto a digitalização vira pixels visíveis.

O tamanho do arquivo é a outra pista. Uma página de texto costuma ter alguns kilobytes; uma digitalizada tem de centenas de kilobytes a vários megabytes, porque é uma fotografia. Um documento de vinte páginas com quarenta megabytes foi digitalizado, não importa a aparência.

Texto que sai embaralhado ao copiar

Às vezes a página realmente contém texto e copiar ainda produz algo sem sentido. Os geradores embutem subconjuntos de fontes e podem numerar os glifos como quiserem, então o código guardado para a letra A pode ser qualquer número. O que devolve esses números a caracteres reais é uma tabela opcional e, quando ela falta ou está errada, a extração devolve fielmente as letras erradas.

Do mesmo lugar vêm dois efeitos menores. Ligaduras são um glifo só, então uma palavra pode chegar com fi ou ffi fundidos num caractere, ou simplesmente sumidos. E um PDF não tem um caractere de espaço no sentido que você esperaria: o vão entre palavras costuma ser apenas um salto para outra posição, e é por isso que o texto extraído às vezes gruda as palavras.

Por que as palavras saem fora de ordem

Nada no PDF declara a ordem de leitura. Os glifos são desenhados na sequência em que o programa gerador os emitiu, o que num layout de duas colunas pode significar uma linha da coluna esquerda, depois uma da direita, alternando até o fim.

Por isso todo extrator reconstrói a ordem a partir da geometria, e cabeçalhos, notas de rodapé, tabelas e boxes laterais são justamente onde essa heurística quebra. Se o seu texto extraído está completo mas embaralhado, a causa é essa — e é um problema diferente de uma página que não tem texto nenhum.

O que o OCR realmente acrescenta

O reconhecimento óptico de caracteres não muda a imagem. Ele lê a fotografia, adivinha os caracteres e os escreve na página como texto invisível posicionado sobre as marcas correspondentes: o que você vê continua sendo a digitalização, e o que a busca encontra é o texto por baixo.

Isso significa que a qualidade do OCR fica congelada de um jeito que a imagem não fica. Os erros típicos sobrevivem em todas as buscas seguintes: rn lido como m, um O maiúsculo como zero, um l minúsculo como o algarismo um. Reconhecer o idioma errado é pior, porque aí letras acentuadas e alfabetos não latinos são espremidos no que o alfabeto escolhido permite.

Quando o PDF com OCR ainda não acha nada

A resolução é a causa mais comum. O reconhecimento quer cerca de 300 pontos por polegada na página impressa; abaixo de uns 200, os traços das letras pequenas se juntam e a precisão despenca. Uma foto tirada em ângulo acrescenta inclinação, e linhas tortas confundem a etapa que procura as linhas antes mesmo de o reconhecimento de caracteres começar.

Há ainda duas falhas que parecem OCR ruim e não são. Um documento pode estar criptografado com permissões que proíbem a extração, então o texto está lá e o visualizador se recusa a entregá-lo. E uma página pode estar girada por um atributo de página em vez de na imagem, o que deixa a camada de texto a noventa graus das palavras que você vê.

A ordem de trabalho que funciona

Extraia o texto primeiro e leia o que sai, porque isso é a verdade sobre o que o arquivo contém. Nada significa que é uma digitalização. Completo mas embaralhado significa problema de ordem, não camada ausente. Estrutura reconhecível com letras erradas significa mapeamento de fonte quebrado, e a correção é reexportar do documento original em vez de brigar com o extrator.

Se for digitalização, rode o reconhecimento antes de arquivar e guarde o original: o OCR é um palpite gravado no arquivo, enquanto a imagem é a prova. E faça isso na maior resolução que você tiver, porque comprimir as páginas antes destrói exatamente o detalhe de que o reconhecedor precisa.

Ferramentas relacionadas