No se produce ningún tratamiento del contenido de tus archivos en servidores, así que no necesitas firmar un contrato de encargo con gottrix para trabajar con documentos confidenciales o de empresa.
Hosted in GermanyGlobal Content Delivery
Servidores de origen en Hetzner (Alemania), con entrega mundial a través de una red de distribución de contenidos (CDN). El contenido de tus archivos nunca se transmite en el proceso: no sale de tu dispositivo.
Markdown es el formato para notas, wikis, sitios estáticos y herramientas de IA: sencillo, versionable y legible en cualquier parte. Quien quiera reutilizar el contenido de un PDF allí tiene que copiarlo laboriosamente. Esta herramienta lee la capa de texto del PDF y la devuelve como Markdown con la estructura general ya aplicada - encabezados, listas y párrafos en lugar de un bloque continuo de texto.
La estructura se detecta mediante una heurística: las líneas con un tamaño de fuente notablemente mayor que el cuerpo del texto se convierten en encabezados (#, ## o ###), las líneas que comienzan con un símbolo de lista o número se transforman en listas Markdown, y una separación vertical mayor entre líneas indica un nuevo párrafo. A partir de las posiciones de texto sin procesar se genera un documento Markdown legible y reutilizable - un punto de partida ideal que puedes perfeccionar en tu editor.
Honesto e importante: esto es una aproximación estructural, no una reconstrucción fiel del diseño. Las tablas, las páginas de varias columnas y los formatos finos no se pueden derivar sin pérdida desde la capa de texto. Como con la extracción de texto plano: un PDF escaneado o compuesto solo de imágenes no tiene capa de texto - el resultado quedará vacío y necesitarás en su lugar el reconocimiento de texto PDF OCR. Todo se ejecuta localmente en el navegador mediante pdf.js; tu archivo no sale de tu dispositivo.
Límites: Convierte la capa de texto existente de un PDF a Markdown (UTF-8 .md). Los encabezados, listas y párrafos se detectan de forma heurística según el tamaño de fuente y el espaciado - una aproximación estructural, no una reconstrucción exacta del diseño. Las tablas y las páginas de varias columnas solo se aproximan de forma lineal. Los PDFs escaneados o compuestos solo de imágenes no tienen capa de texto; el resultado queda vacío, usa PDF OCR en su lugar. Desbloquea primero los PDFs protegidos con contraseña. Solo se lee el texto (getTextContent de pdf.js); las imágenes incrustadas no se incluyen en el Markdown.
Preguntas frecuentes
¿Cómo se detectan los encabezados?
Por el tamaño de fuente: las líneas notablemente más grandes que el cuerpo del texto se convierten en #, ## o ### según la proporción.
¿Se conservan las tablas y columnas?
No. La conversión es una aproximación estructural; las tablas y los diseños de varias columnas solo se aproximan de forma lineal, sin reconstruirse fielmente.
¿Por qué está vacío mi Markdown?
Probablemente tu PDF es un escaneado o está compuesto de imágenes y no tiene capa de texto. Usa PDF OCR, que reconoce el texto a partir de los píxeles.
¿Se sube el PDF a algún servidor?
No. La conversión se ejecuta completamente de forma local en el navegador mediante pdf.js; el archivo no sale de tu dispositivo.
Solo con tu consentimiento medimos el uso de forma anonimizada mediante cookies para mejorar gottrix. Tus archivos siempre permanecen en local, en tu dispositivo. Privacidad