Cómo pasar un PDF escaneado a texto (OCR)
Un PDF escaneado se ve como un documento, pero para el ordenador es una pila de fotos: no puedes seleccionar, buscar ni copiar nada. El OCR lee las letras de esas imágenes y las convierte en texto de verdad. Qué hace falta para que acierte, y cómo hacerlo sin subir el documento a ninguna web.
Primero, comprueba si tu PDF necesita OCR
No todos los PDF son imágenes. Para saberlo, abre el archivo e intenta seleccionar una palabra con el ratón, o pulsa Ctrl+F (Cmd+F en Mac) y busca una palabra que sepas que está en el documento. Si el texto se selecciona y la búsqueda lo encuentra, el PDF ya tiene capa de texto y no necesitas OCR: basta extraerlo con la herramienta de extraer texto de un PDF. Si no se puede seleccionar nada, es una imagen y el OCR es el camino.
Qué hace el OCR
OCR (reconocimiento óptico de caracteres) analiza la imagen de cada página, identifica la forma de las letras y las convierte en texto. Es el trabajo de las aplicaciones de escáner del móvil. La herramienta de OCR de PDF de UtilsDock dibuja cada página como una imagen con resolución suficiente para leer letra pequeña, la pasa por un motor de reconocimiento (Tesseract.js) que se ejecuta en tu propio dispositivo y junta el texto de todas las páginas en un solo bloque que puedes copiar o descargar. Las imágenes del PDF no se suben a ningún servidor, algo que importa si es un contrato, una nómina o un documento con datos personales.
La primera vez tarda un poco más, porque el motor y los datos del idioma (unos megas) se descargan y el navegador los guarda; después va más rápido. Si lo que tienes no es un PDF sino una foto, la herramienta de extraer texto de una imagen usa el mismo motor.
Cómo conseguir que acierte: lo que más influye
La precisión del OCR depende sobre todo de la calidad de la imagen de partida. La documentación de Tesseract, el motor de OCR de código abierto más usado, recoge los factores que más pesan:
- Resolución. Tesseract funciona mejor con imágenes de al menos 300 dpi, y recomienda ampliar las más pequeñas. Un escaneo a 200 ppp puede servir si la letra es grande y nítida, pero con letra pequeña o fuentes finas, 300 ppp da mejores resultados.
- Texto recto. Una página escaneada torcida reduce mucho la calidad de la segmentación de las líneas, y con ella la del OCR. Si tu escaneo salió inclinado, enderézalo antes con la herramienta de enderezar documento escaneado.
- Texto oscuro sobre fondo claro. Es lo que mejor lee el motor; los fondos de color o las páginas con sombra del lomo del libro empeoran el resultado.
- Sin bordes oscuros. Los bordes negros que dejan los escáneres alrededor de la página pueden leerse por error como caracteres. Recorta la imagen hasta una zona de texto con un margen razonable.
- Sin ruido. El ruido (variaciones aleatorias de brillo o color) hace más difícil leer el texto. Un escaneo limpio, bien iluminado y sin arrugas lee mucho mejor que una foto hecha de lado con poca luz.
El idioma importa
El motor usa un modelo distinto para cada idioma. La herramienta aplica el del idioma de la página: en esta versión, el español. Un documento en otro idioma se lee peor, y uno en español leído con un modelo de inglés confunde tildes, «ñ» y signos como «¿» y «¡». Si tu documento está en un idioma distinto del de la página, espera más errores y revisa con más cuidado.
Qué esperar del resultado
- Letra impresa limpia: muy buena, con algún error aislado.
- Letra manuscrita: mucho menos fiable. El OCR está pensado para texto impreso.
- Tablas y columnas: el texto puede salir en un orden extraño o con las columnas mezcladas.
- Cifras y códigos: un 0 y una O, o un 1 y una l, se confunden con facilidad. Revisa cualquier importe, fecha, número de documento o IBAN comparándolo con el original.
Por eso, no te fíes del resultado para nada importante sin revisarlo. Una pasada rápida con el original al lado detecta casi todos los errores.
Lo que esta herramienta no hace
Te devuelve el texto, no un PDF con las imágenes originales y una capa de texto invisible añadida, que es el formato que producen los programas de escritorio y que permite buscar dentro del PDF. Es un archivo más complejo de construir de lo que un navegador puede producir con fiabilidad. Si lo que necesitas es un PDF «buscable» para archivarlo, usa un programa de PDF que lo haga; si necesitas el contenido para copiarlo, citarlo o editarlo, el texto basta.
Antes de empezar: prepara el documento
- Escanea a 300 ppp si puedes, o vuelve a escanear solo las páginas que salgan mal.
- Revisa que las páginas estén derechas, con buen contraste y sin sombras.
- Si el PDF es muy pesado, no lo comprimas antes: la compresión agresiva borra detalle y el OCR lo nota.
- Al terminar, compara el texto con el original en las partes críticas.
Si el documento contiene datos sensibles, recuerda que todo el proceso ocurre en tu navegador; tras hacer OCR puedes además tachar los datos que no quieras compartir antes de enviarlo.
Fuentes y más información
Datos comprobados el 3 de octubre de 2026.
Hazlo ahora, gratis y en tu navegador. Tus archivos no se suben.
Lee el texto de un PDF escaneado y obtenlo como texto plano y buscable.
Preguntas frecuentes
¿Cómo sé si un PDF es una imagen?
¿Cómo paso un PDF escaneado a texto gratis?
¿Qué resolución necesito para que el OCR acierte?
¿Por qué el OCR confunde letras y números?
¿Funciona el OCR con letra manuscrita?
¿Obtengo un PDF buscable?
Guías relacionadas
Herramientas de esta guía
Funcionan en tu navegador: no se sube nada.