Por qué no se puede buscar dentro de tu PDF
El PDF no es un formato de texto que además está maquetado. Es una descripción de página: una lista de instrucciones que dicen dibuja este glifo en esta posición, o pinta esta imagen sobre este rectángulo. Una página hecha con un procesador de textos dibuja caracteres y se puede buscar. Una página hecha con un escáner o con la cámara del móvil dibuja una sola fotografía, y nada dentro del archivo sabe qué dice esa fotografía.
Dos tipos de página que en pantalla son idénticos
Una página de texto lleva fuentes, códigos de carácter y coordenadas. Una página escaneada lleva una imagen, normalmente la hoja entera, y nada más. Las dos se dibujan como una página escrita y, con el zoom normal, no se distinguen.
La diferencia solo aparece cuando algo intenta leer la página en lugar de dibujarla: buscar, seleccionar, copiar, un lector de pantalla o un programa que extrae datos. Todo eso necesita caracteres, y en una página escaneada no hay ninguno.
Cómo distinguirlas en unos segundos
Intenta seleccionar una línea. Si el cursor dibuja un rectángulo sobre una zona en vez de resaltar palabras, la página es una imagen. Después amplía mucho: el texto real se mantiene nítido a cualquier aumento porque se redibuja desde los contornos de la fuente, mientras que un escaneo se convierte en píxeles visibles.
El tamaño del archivo es la otra pista. Una página de texto suele ocupar unos pocos kilobytes; una escaneada, de cientos de kilobytes a varios megabytes, porque es una fotografía. Un documento de veinte páginas que pesa cuarenta megabytes está escaneado, tenga el aspecto que tenga.
Texto que al copiarse sale como galimatías
A veces la página sí contiene texto y copiarlo sigue dando algo sin sentido. Los generadores incrustan subconjuntos de fuentes y pueden numerar los glifos como quieran, así que el código guardado para la letra A puede ser cualquier número. Lo que devuelve esos números a caracteres reales es una tabla opcional, y cuando falta o está mal, la extracción devuelve fielmente las letras equivocadas.
Del mismo sitio salen dos efectos menores. Las ligaduras son un único glifo, así que una palabra puede llegar con fi o ffi fundidos en un carácter, o directamente perdidos. Y un PDF no tiene un carácter de espacio en el sentido que esperarías: el hueco entre palabras suele ser solo un salto a otra posición, y por eso el texto extraído a veces junta las palabras.
Por qué las palabras salen desordenadas
Nada en un PDF indica el orden de lectura. Los glifos se dibujan en la secuencia que emitió el programa que los generó, lo que en una maqueta a dos columnas puede significar una línea de la izquierda, luego una de la derecha, alternando hasta el final.
Por eso cada extractor reconstruye el orden a partir de la geometría, y los encabezados, las notas al pie, las tablas y los recuadros laterales son justo donde esa heurística se rompe. Si tu texto extraído está completo pero revuelto, la causa es esta, y es un problema distinto al de una página que no tiene texto alguno.
Qué añade realmente el OCR
El reconocimiento óptico de caracteres no cambia la imagen. Lee la fotografía, adivina los caracteres y los escribe en la página como texto invisible colocado sobre las marcas correspondientes: lo que ves sigue siendo el escaneo, y lo que encuentra el buscador es el texto de debajo.
Eso significa que la calidad del OCR queda fijada de una forma en que la imagen no lo está. Sus errores habituales sobreviven a todas las búsquedas posteriores: rn leído como m, una O mayúscula como un cero, una l minúscula como el dígito uno. Reconocer el idioma equivocado es peor, porque entonces las letras acentuadas y los alfabetos no latinos se fuerzan dentro de lo que permite el alfabeto elegido.
Cuando el PDF con OCR sigue sin encontrar nada
La resolución es la causa habitual. El reconocimiento pide unos 300 puntos por pulgada sobre la página impresa; por debajo de unos 200, los trazos de la letra pequeña se juntan y la precisión se desploma. Una foto tomada en ángulo añade inclinación, y las líneas torcidas confunden la etapa que busca renglones antes incluso de empezar a reconocer caracteres.
Hay además dos fallos que parecen mal OCR y no lo son. Un documento puede estar cifrado con permisos que prohíben la extracción, así que el texto está ahí y el visor se niega a entregarlo. Y una página puede estar girada por un atributo de página en vez de en la imagen, lo que deja la capa de texto a noventa grados de las palabras que ves.
El orden de trabajo que funciona
Extrae primero el texto y lee lo que sale, porque eso es la verdad sobre lo que contiene el archivo. Si no sale nada, es un escaneo. Si sale completo pero desordenado, es un problema de orden, no una capa que falte. Si la estructura se reconoce pero las letras están mal, el mapeo de la fuente está roto, y la solución es volver a exportar desde el documento original en lugar de pelearse con el extractor.
Si es un escaneo, pasa el reconocimiento antes de archivarlo y conserva el original: el OCR es una conjetura escrita en el archivo, mientras que la imagen es la prueba. Y hazlo con la mayor resolución que tengas, porque comprimir las páginas antes destruye justo el detalle que el reconocedor necesita.