OCR de PDF

Suelta un PDF escaneado, la foto de un documento guardada como PDF, o cualquier cosa sin una capa de texto real, y esta herramienta lee el texto visualmente, página a página, dándote texto plano que puedes copiar, buscar o descargar.

  • Gratis
  • Sin registro
  • Funciona en tu navegador
pdf-ocr

100 % privado — el PDF se procesa en tu navegador y nunca se sube.

Cómo funciona

Suelta tu PDF escaneado

Un documento sin texto seleccionable.

Espera mientras lee cada página

Una nota de progreso muestra la página y el porcentaje.

Copia o descarga el texto

Texto plano sacado de las imágenes.

Cuando un PDF es en realidad solo una imagen de texto

Un contrato escaneado, el recibo de una foto guardada como PDF, un documento antiguo digitalizado hace años: todos parecen texto en pantalla, pero para un ordenador son solo imágenes, sin ninguna capa de texto que seleccionar, buscar o copiar. El reconocimiento óptico de caracteres, OCR, lee visualmente la forma de las letras y las convierte de vuelta en texto real, el mismo trabajo que hace una app de escáner de documentos en un móvil.

Cómo funciona

Cada página del PDF se dibuja como una imagen a una resolución buena para leer texto pequeño, y un motor de reconocimiento de texto, que se ejecuta por completo en tu dispositivo, lee las letras y palabras de esa imagen. El texto reconocido de todas las páginas se combina en un solo bloque que puedes copiar, buscar o descargar.

La primera vez tarda un poco más

El motor de reconocimiento y sus datos de idioma, unos pocos megabytes, se descargan la primera vez que usas esta herramienta o la de extraer texto de imagen, y tu navegador los conserva después. Esto significa que la primera página tarda más que el resto mientras termina esa descarga; las páginas siguientes van más rápido.

Conseguir un buen resultado

La precisión del OCR depende mucho de la calidad del escaneo: uno claro, de buena resolución y bien iluminado, con el texto recto y sin girar, se lee mucho mejor que una foto borrosa tomada en ángulo. Si el documento de origen está torcido, la herramienta de enderezar puede ayudar antes de pasar el OCR. La escritura a mano se lee mucho menos fiable que el texto impreso, y hay que esperar algún error en cualquier origen, así que revisa siempre el resultado en lugar de confiar ciegamente en él para algo importante.

Lo que no hace

Esto te da el texto, no un PDF buscable con las imágenes originales y una capa de texto invisible añadida de vuelta, un formato de archivo más complejo de construir de lo que puede producir razonablemente una herramienta de navegador. Lee lo que es visible y devuelve solo texto. Todo se ejecuta en tu navegador: las imágenes de tu PDF nunca se suben a ningún sitio.

Preguntas frecuentes

¿Cómo saco el texto de un PDF escaneado?
Suéltalo aquí. Cada página se lee visualmente con OCR en tu dispositivo, y el texto reconocido se combina para que lo copies o descargues.
¿Por qué la primera página tarda tanto?
El motor de reconocimiento de texto se descarga la primera vez que lo usas, unos pocos megabytes. Después, las páginas se leen más rápido.
¿Cuánta precisión tiene el resultado?
Depende de la calidad del escaneo. Los escaneos claros, rectos y de buena resolución se leen muy bien; las fotos borrosas o torcidas producen más errores. Revisa siempre el resultado.
¿Funciona con escritura a mano?
No de forma fiable. Esto funciona mejor con texto impreso; el reconocimiento de escritura a mano es mucho menos preciso.
¿Obtengo un PDF buscable de vuelta, o solo texto?
Solo el texto. Esto no reconstruye un PDF con una capa de texto oculta añadida a las imágenes originales.
¿Se sube mi PDF a algún sitio?
No. Cada página se lee por completo en tu dispositivo.