No se produce ningún tratamiento del contenido de tus archivos en servidores, así que no necesitas firmar un contrato de encargo con gottrix para trabajar con documentos confidenciales o de empresa.
Hosted in GermanyGlobal Content Delivery
Servidores de origen en Hetzner (Alemania), con entrega mundial a través de una red de distribución de contenidos (CDN). El contenido de tus archivos nunca se transmite en el proceso: no sale de tu dispositivo.
Un PDF es una maquetación cerrada, no texto editable: cuesta seleccionar párrafos, reescribir frases o seguir calculando con una tabla. Esta herramienta lee la estructura real de tu PDF (títulos, párrafos, listas, tablas, notas al pie e imágenes) y construye con ella, en tu propio dispositivo, un archivo DOCX auténtico en formato Office Open XML, listo para abrirse en Word, en LibreOffice Writer o en cualquier otro programa que entienda archivos .docx. Sin marca de agua, sin cuenta y sin límite diario: la conversión ocurre en la pestaña del navegador y no en un servidor.
A nivel de párrafo y de carácter se conserva mucho más que la negrita y la cursiva. Los títulos se convierten en títulos reales de Word de los niveles 1 a 6, con su nivel de esquema, de modo que el panel de navegación y el índice automático funcionan de inmediato. Las listas anidadas mantienen sus niveles como una lista multinivel auténtica. Los subrayados y los tachados se reconocen por las líneas realmente dibujadas en la página, los superíndices y subíndices por su línea base desplazada, y un resaltado de color se asigna al más cercano de los 16 colores de resaltado que el formato de Word admite. Los enlaces del PDF pasan a ser hipervínculos en los que se puede hacer clic, y las anotaciones al pie de página se convierten en notas al pie reales, dentro del gestor de notas y no como texto suelto al final de la página.
Las tablas se detectan por tres vías distintas: por las líneas de recuadro reales, tomando el ancho de columna de la geometría medida de esas líneas y manteniendo unidas las celdas combinadas sencillas; por un espacio entre columnas claramente recurrente cuando la tabla no tiene ninguna línea; y por una secuencia de al menos tres líneas consecutivas del tipo «campo: valor», como las que generan los PDF de formulario. El tamaño de página, la orientación vertical u horizontal, los márgenes y el número de columnas de texto se toman de la geometría real de la página en lugar de suponer un A4; en cada límite de página original queda un salto de página limpio, y las imágenes se incrustan en su sitio dentro del flujo de lectura conservando su proporción, incluidos los gráficos dibujados solo con vectores, que también se reconocen como figuras. Los encabezados y pies recurrentes se convierten en encabezados y pies reales con tabulaciones a la izquierda, al centro y a la derecha; un número de página continuo pasa a ser un campo vivo de Word en lugar de una cifra congelada, y una marca de agua recurrente se conserva.
Con las fuentes, la herramienta va por el camino directo: los programas de fuente incrustados en el PDF de origen se trasladan sin modificar al archivo de Word, por separado para la variante normal, negrita, cursiva y negrita cursiva. Así, un párrafo en negrita recibe los contornos reales del diseño tipográfico y no un engrosamiento calculado después por el procesador de textos. Solo donde el PDF no incluye ninguna fuente entra una tipografía sustituta de métricas compatibles y licencia abierta, que también se incrusta en el archivo, de modo que el documento se ve correcto incluso en otro equipo que no tenga esas fuentes instaladas. El texto fuera del alfabeto latino recibe además la marca de escritura y de idioma adecuada, para que Word componga bien el chino, el japonés, el coreano, el árabe o el hebreo, escriba de derecha a izquierda donde corresponde y el corrector ortográfico elija el idioma correcto.
Buena parte del trabajo está en los PDF que se salen de la norma. Una página guardada de lado se analiza en su propia dirección de lectura, para que una tabla no llegue transpuesta y un título no acabe leyéndose en vertical. Los PDF impresos desde el navegador, por ejemplo con «Imprimir en PDF» en Chrome o Edge, dibujan las viñetas como diminutos cuadrados vectoriales en vez de como caracteres de texto, y pegan toda una fila de tabla en una única línea: ambas cosas se reconocen por la geometría y se vuelven a separar en listas auténticas y en celdas individuales. Un número de página solo se convierte en encabezado o pie cuando realmente sigue contando a lo largo del documento; una línea aislada que solo parece un número de página se queda en el texto, y los identificadores variables como «K-6» o «K-86» se conservan en lugar de descartarse como elementos accesorios.
Hay dos cosas que la herramienta te dice abiertamente en lugar de callarlas. Si en el PDF de origen había texto detrás de una barra negra opaca pero seguía siendo legible como texto, el error clásico de tachar pintando un rectángulo encima, ese texto no pasa al archivo de Word y se te indica en qué páginas ocurrió. Y si hay caracteres del PDF que no llevan ningún valor Unicode, que es también lo que hace fallar el copiado desde cualquier visor de PDF, se cuantifica su proporción y se te remite a «PDF OCR» en vez de dejarte un hueco silencioso. El análisis y el montaje del archivo se hacen enteramente en la pestaña del navegador: tu PDF no sale de tu dispositivo y, tras la primera carga, la herramienta también funciona sin conexión.
La estructura, las tablas, las fuentes y las imágenes se detectan localmente y pasan a un DOCX.
Descarga el DOCX y sigue editándolo en Word o LibreOffice.
Límites: Reproducción estructurada, no una copia píxel a píxel del PDF. Se conservan: títulos con nivel de esquema, párrafos, listas ordenadas y sin ordenar de varios niveles, negrita, cursiva, subrayado, tachado, superíndices y subíndices, resaltados de texto (redondeados a los colores de resaltado de Word), hipervínculos activos, notas al pie reales, imágenes y gráficos vectoriales dentro del flujo de lectura, encabezados y pies reales con campo de número de página vivo, además del formato de página, la orientación, los márgenes y el número de columnas tomados de la geometría real. Las tablas se detectan por líneas de recuadro, por un espacio de columna recurrente o por líneas del tipo «campo: valor»; por ahora solo se evalúa una región de tabla contigua por página, así que si hay varias tablas con recuadro propio apiladas pasan deliberadamente como texto corrido en lugar de montarse mal, y las tablas muy anidadas o con muchas celdas combinadas siguen siendo débiles. Cada celda contiene un párrafo. Otros límites honestos: un fragmento de color dentro de un tramo de texto compuesto de forma continua pierde su color propio, y un resaltado que cubre solo una parte de ese tramo colorea el tramo entero; un enlace sin dirección de destino guardada en el PDF se omite; un enlace dentro del texto de una nota al pie deja de ser pulsable; una lista con viñetas anidada dentro de una numerada adopta en su nivel la marca numerada (el contenido y el anidamiento son correctos, solo no el signo); si el encabezado cambia en cada capítulo, se queda como texto normal del documento en lugar de convertirse en un encabezado propio por capítulo. Las páginas de diseño muy elaborado con texto que rodea las figuras se aproximan, y en páginas con varios miles de elementos de línea o vectoriales se omite la detección de tablas y gráficos. Los PDF escaneados o solo con imágenes no tienen capa de texto: en ese caso aparece un aviso sobre «PDF OCR» en vez de un resultado vacío. Abre primero los PDF protegidos con contraseña con «Desbloquear PDF».
Preguntas frecuentes
¿Se sube el PDF a un servidor?
No. El PDF se abre en la pestaña del navegador, se analiza allí y allí mismo se monta el archivo de Word; no hay ningún servidor que llegue a ver el archivo. Después de la primera visita la herramienta sigue funcionando incluso en modo avión, la prueba más sencilla de que no se sube nada.
¿El archivo de Word se ve igual que el PDF?
No, y es intencionado. Un PDF es una maquetación fija y un documento de Word es texto que fluye: una copia punto por punto ya no sería editable de forma razonable en Word. Por eso se traslada el significado: títulos, párrafos, listas, tablas, notas al pie, imágenes, encabezados y pies, además del formato de página y los márgenes. Las páginas de diseño muy elaborado con texto rodeando las figuras se aproximan.
¿Los títulos se mantienen como títulos reales de Word?
Sí. Las líneas compuestas en mayor tamaño y con más peso se reconocen como títulos de los niveles 1 a 6 y reciben el nivel de esquema correspondiente. Así funcionan no solo los estilos, sino también el panel de navegación y el índice generado automáticamente en Word, de inmediato y sin que tengas que reformatear nada.
¿Se conserva la fuente original del PDF?
Sí, siempre que el PDF la incluya. Los archivos de fuente incrustados en el PDF de origen se trasladan sin modificar al archivo de Word, por separado para la variante normal, negrita, cursiva y negrita cursiva. Solo cuando falta una fuente en el PDF entra una sustituta de métricas compatibles y licencia abierta, que también se incrusta, de modo que el documento se ve bien incluso en un equipo donde esas fuentes no están instaladas.
¿Se conservan las tablas?
Las tablas con líneas de recuadro visibles se convierten en tablas reales de Word, con anchos de columna tomados de la geometría medida y con las celdas combinadas sencillas intactas. También se reconocen las tablas sin recuadro con un espacio de columna claramente recurrente y las líneas de formulario del tipo «campo: valor». Por ahora solo se evalúa una región de tabla contigua por página: si hay varias tablas con recuadro propio apiladas, pasan deliberadamente como texto corrido en vez de montarse mal.
¿Funciona con páginas giradas o apaisadas?
Sí. Una página guardada girada dentro del PDF se analiza en su propia dirección de lectura y no en la del resto del documento. Así, una tabla de esa página mantiene sus filas y columnas en el sentido correcto, y un título no se trata por error como texto compuesto en vertical.
¿Se reconocen las listas con viñetas de un PDF impreso desde el navegador?
Sí. Al imprimir en PDF, Chrome y Edge dibujan los puntos de una lista no como caracteres de texto, sino como diminutos cuadrados vectoriales, con lo que las viñetas resultan invisibles para un lector de texto puro. La herramienta las reconoce por su tamaño y porque quedan alineadas en una misma columna, y restaura la lista con todos sus niveles. Del mismo origen se vuelven a separar en celdas individuales las filas de tabla pegadas.
¿Se trasladan las imágenes, los enlaces y las notas al pie?
Sí, las tres cosas. Las imágenes incrustadas se insertan en su sitio dentro del flujo de lectura, con la anchura limitada y la proporción intacta; los gráficos dibujados solo con vectores también se reconocen como figuras. Los enlaces con destino guardado pasan a ser hipervínculos pulsables, y las anotaciones al pie de página, notas al pie reales. Un enlace sin dirección de destino se omite, y un enlace dentro del texto de una nota al pie deja de ser pulsable.
¿Qué ocurre con el texto tapado con una barra negra en el PDF de origen?
No pasa al archivo de Word. Si el tachado se hizo pintando un rectángulo negro sobre el texto en lugar de eliminarlo de verdad, el texto sigue siendo perfectamente legible dentro del PDF, un error frecuente y de consecuencias serias. La herramienta detecta el texto que queda por completo detrás de una superficie oscura opaca, lo deja fuera y te indica en qué páginas ha ocurrido.
¿Qué ocurre con un PDF escaneado?
Un escaneo se compone de imágenes y no tiene capa de texto. La herramienta lo dice con honestidad y remite a «PDF OCR» en vez de generar un archivo de Word vacío. Si un archivo sí lleva texto pero sus caracteres no tienen valor Unicode guardado, se cuantifica la proporción afectada: entonces también falla el copiado desde un visor de PDF, y el OCR es el camino de vuelta al texto.
Solo con tu consentimiento medimos el uso de forma anonimizada mediante cookies para mejorar gottrix. Tus archivos siempre permanecen en local, en tu dispositivo. Privacidad