Suelta tu PDF
Cualquier PDF con texto real y seleccionable.
Suelta un PDF y obtén su texto como Markdown: el texto notablemente más grande que el cuerpo se convierte en encabezados, para que se note la estructura del documento original en lugar de un solo bloque plano de texto.
100 % privado — el PDF se procesa en tu navegador y nunca se sube.
Cualquier PDF con texto real y seleccionable.
Se comparan los tamaños de letra para calcular los encabezados.
Listo para pegar en un editor Markdown o una wiki.
Extraer texto plano de un PDF te da las palabras pero pierde la forma del documento: lo que era un encabezado se ve igual que un párrafo. Esta herramienta da un paso más y compara el tamaño de letra de cada línea de texto con el tamaño más común de la página, el texto del cuerpo, y convierte las líneas notablemente más grandes en encabezados Markdown, para que un documento con una estructura clara de títulos y secciones salga más legible que un muro plano de texto.
El texto con un tamaño de aproximadamente 1,15 a 1,35 veces el del cuerpo se convierte en un encabezado de nivel tres, de 1,35 a 1,7 veces en nivel dos, y cualquier cosa mayor en encabezado de nivel uno. Es una heurística basada en el tamaño, no una comprensión real de la estructura del documento, así que funciona mejor en documentos con una jerarquía visual clara y consistente, como un informe con títulos de sección evidentes, y peor en documentos que usan texto en negrita o un estilo poco habitual para dar énfasis en lugar del tamaño.
El Markdown de cada página se separa con una línea horizontal, para que veas dónde terminó una página y empezó la siguiente en el documento de origen, un contexto útil si un encabezado queda partido por un salto de página incómodo.
Esto no detecta negrita, cursiva, enlaces, tablas ni listas, solo encabezados basados en el tamaño; todo lo demás sale como texto de párrafo normal. Para el texto exacto sin ningún intento de estructura, usa extraer texto de un PDF en su lugar. Los PDF escaneados sin capa de texto real necesitan antes OCR de PDF. Tu archivo se procesa por completo en tu navegador y nunca se sube.
Otras utilidades que también funcionan sin salir de tu navegador.