No se produce ningún tratamiento del contenido de tus archivos en servidores, así que no necesitas firmar un contrato de encargo con gottrix para trabajar con documentos confidenciales o de empresa.
Hosted in GermanyGlobal Content Delivery
Servidores de origen en Hetzner (Alemania), con entrega mundial a través de una red de distribución de contenidos (CDN). El contenido de tus archivos nunca se transmite en el proceso: no sale de tu dispositivo.
Los números suelen quedarse atrapados justo donde no se pueden aprovechar: en tablas dentro de un PDF. Facturas, informes, extractos bancarios, estudios: quien necesita esos valores en Excel, una base de datos o un script, hasta ahora los copiaba a mano o luchaba con columnas que se rompen al pegar. Esta herramienta reconoce las tablas del PDF automáticamente y las exporta con su estructura: como CSV para hojas de cálculo e importaciones, como libro de Excel (XLSX) con una hoja por tabla o como JSON con coordenadas para procesarlas en código.
La detección usa dos técnicas, las mismas en las que se apoyan las herramientas especializadas conocidas: las tablas con bordes se reconocen por las líneas realmente dibujadas en la página (modo cuadrícula); las líneas forman la retícula de celdas y cada texto se asigna a su celda. Las tablas sin bordes se reconocen por la alineación (modo espacios): los bloques de texto situados en las mismas posiciones de columna a lo largo de varias líneas forman las columnas, y los huecos continuos marcan sus límites. El modo automático busca primero líneas y, si no hay, analiza los espacios; ambos modos también pueden forzarse. Se admiten varias tablas y PDF de varias páginas: cada tabla detectada se exporta por separado.
Honesto e importante: la detección lee la capa de texto del PDF. Un PDF escaneado o compuesto solo de imágenes no tiene esa capa; ahí la herramienta lo dice abiertamente en lugar de producir tablas vacías o inventadas. Convierte primero los escaneos con "PDF OCR" y extrae las tablas después. Los diseños complejos tienen límites: las celdas combinadas o anidadas se aproximan, no se reconstruyen píxel a píxel. Todo se ejecuta localmente en el navegador mediante pdf.js; tu archivo nunca sale de tu dispositivo.
Ficha técnica
Ficha técnica
Formatos de entrada
PDF
Conversión automática
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Formatos de salida
CSV, XLSX, JSON
Procesamiento por lotes
No
Procesamiento
Local en el navegador (JavaScript)
Subida de archivos
Ninguna
En 3 pasos
Suelta tu PDF.
Elige formato de salida y detección.
Descarga las tablas como CSV, XLSX o JSON.
Límites: Detecta tablas mediante líneas de borde (cuadrícula) o alineación del texto (espacios) y las exporta como CSV (un archivo por tabla, varias como ZIP), XLSX (una hoja por tabla) o JSON (con página, celdas y posiciones en puntos PDF). Requiere una capa de texto real: convierte primero los PDF escaneados con "PDF OCR". Las celdas combinadas y los diseños complejos se aproximan; en Excel solo los números inequívocos (decimal con punto) se convierten en celdas numéricas. Abre antes los PDF protegidos con "Desbloquear PDF".
Preguntas frecuentes
¿Cómo detecta las tablas la herramienta?
Con dos técnicas: en las tablas con bordes, las líneas dibujadas forman la retícula de celdas (modo cuadrícula). En las tablas sin bordes, las columnas se reconocen por la alineación del texto y los huecos continuos (modo espacios). El modo automático elige la técnica adecuada.
¿Por qué no encuentra tablas en mi documento escaneado?
Un escaneo son solo píxeles de imagen, sin capa de texto que leer. Convierte primero el PDF en texto con "PDF OCR" y extrae las tablas después.
¿Puedo exportar varias tablas y páginas a la vez?
Sí. Se recorren todas las páginas y cada tabla detectada se exporta por separado: como CSV propio (varias agrupadas en un ZIP), como hoja propia en un archivo de Excel o como entrada en el JSON.
¿Qué contiene la exportación JSON?
La estructura completa: por tabla, su página, modo de detección y posición; por celda, su texto y su recuadro en puntos PDF (origen abajo a la izquierda). Ideal para scripts y canalizaciones de datos.
¿Por qué las celdas combinadas no salen exactas?
Una celda combinada sobre varias columnas no tiene posición única en la retícula; su contenido cae en una de las celdas implicadas y las demás quedan vacías. Es una aproximación honesta: ni las herramientas de escritorio especializadas lo resuelven sin fallos.
¿Se sube mi PDF?
No. La detección y la exportación se ejecutan por completo localmente en el navegador mediante pdf.js; el archivo nunca sale de tu dispositivo.
¿La extracción de tablas funciona también en el móvil o un Chromebook?
Sí, en cualquier dispositivo con un navegador actual - Windows, Mac, Linux, Chromebook o móvil. Los PDF muy grandes solo necesitan más tiempo y memoria en dispositivos móviles.
Solo con tu consentimiento medimos el uso de forma anonimizada mediante cookies para mejorar gottrix. Tus archivos siempre permanecen en local, en tu dispositivo. Privacidad