El contingut es queda amb tusense accés de tercers
No hi ha cap tractament del contingut dels teus fitxers en cap servidor. No et cal cap contracte d'encàrrec de tractament amb gottrix per treballar amb documents confidencials o de feina.
Hosted in GermanyGlobal Content Delivery
Servidors d'origen a Hetzner, a Alemanya, amb lliurament mundial mitjançant una xarxa de distribució de continguts (CDN). El contingut dels teus fitxers no es transmet mai en aquest procés - no surt mai del teu dispositiu.
Els números sovint queden atrapats just on no es poden aprofitar: a les taules d'un PDF. Factures, informes, extractes bancaris, estudis: qui necessita aquests valors a Excel, en una base de dades o en un script fins ara els tornava a escriure o lluitava amb columnes que es desfan en enganxar-les. Aquesta eina reconeix automàticament les taules del PDF i les exporta amb l'estructura intacta: com a CSV per a fulls de càlcul i importacions, com a llibre d'Excel (XLSX) amb un full per taula o com a JSON amb coordenades per processar-les amb codi.
La detecció fa servir les dues mateixes tècniques que les eines especialitzades conegudes: les taules amb vores es reconeixen per les línies realment dibuixades a la pàgina (mode graella); les línies formen la graella de cel·les i cada text s'assigna a la seva cel·la. Les taules sense vores es reconeixen per l'alineació (mode espais): els blocs de text situats a les mateixes posicions de columna al llarg de diverses línies formen les columnes, i els buits continus en marquen els límits. El mode automàtic cerca primer línies i, si no n'hi ha, analitza els espais; tots dos modes també es poden forçar. S'admeten diverses taules i PDF de diverses pàgines: cada taula detectada s'exporta per separat.
Honest i important: la detecció llegeix la capa de text del PDF. Un PDF escanejat, o fet només d'imatges, no té aquesta capa; en aquest cas l'eina ho diu obertament en lloc de produir taules buides o inventades. Converteix primer els escanejos amb "PDF OCR" i extreu les taules després. Els dissenys complexos tenen límits: les cel·les combinades o les taules imbricades s'aproximen, no es reconstrueixen píxel a píxel. Tot s'executa en local al navegador via pdf.js; el teu fitxer no surt mai del teu dispositiu.
Fitxa tècnica
Fitxa tècnica
Formats d'entrada
PDF
Conversió automàtica
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Formats de sortida
CSV, XLSX, JSON
Processament per lots
No
Processament
En local al navegador (JavaScript)
Càrrega de fitxers
Cap
En 3 passos
Deixa anar el teu PDF.
Tria el format de sortida i la detecció.
Baixa les taules com a CSV, XLSX o JSON.
Límits: Detecta taules mitjançant les línies de vora (graella) o l'alineació del text (espais) i les exporta com a CSV (un fitxer per taula, diverses en un ZIP), XLSX (un full per taula) o JSON (amb pàgina, cel·les i posicions en punts PDF). Cal una capa de text real: converteix primer els PDF escanejats amb "PDF OCR". Les cel·les combinades i els dissenys complexos s'aproximen; a Excel només els nombres inequívocs (decimal amb punt) esdevenen cel·les numèriques. Obre abans els PDF protegits amb "Desbloqueja PDF".
Preguntes freqüents
Com detecta les taules aquesta eina?
Amb dues tècniques: a les taules amb vores, les línies dibuixades formen la graella de cel·les (mode graella). A les taules sense vores, les columnes es reconeixen per l'alineació del text i els buits continus (mode espais). El mode automàtic tria la tècnica adequada tot sol.
Per què no troba taules al meu document escanejat?
Un escaneig només són píxels d'imatge, sense capa de text llegible. Converteix primer el PDF en text cercable amb "PDF OCR" i després extreu les taules.
Puc exportar diverses taules i pàgines alhora?
Sí. Es recorren totes les pàgines i cada taula detectada s'exporta per separat: com a fitxer CSV propi (diversos agrupats en un ZIP), com a full propi d'un fitxer Excel o com a entrada del JSON.
Què conté l'exportació JSON?
L'estructura completa: per a cada taula, la pàgina, el mode de detecció i la posició; per a cada cel·la, el text i el requadre en punts PDF (origen a baix a l'esquerra). Ideal per a scripts i fluxos de dades.
Per què les cel·les combinades no surten exactes?
Una cel·la combinada sobre diverses columnes no té una posició única a la graella; el contingut cau en una de les cel·les implicades i la resta queden buides. És una aproximació honesta: ni les eines d'escriptori especialitzades ho resolen sense errors.
Es puja el meu PDF a algun servidor?
No. La detecció i l'exportació s'executen completament en local al navegador via pdf.js; el fitxer no surt mai del teu dispositiu.
L'extracció de taules funciona també al mòbil o en un Chromebook?
Sí, en qualsevol dispositiu amb un navegador actual - Windows, Mac, Linux, Chromebook o mòbil. Els PDF molt grans només necessiten més temps i memòria als dispositius mòbils.
Només amb el teu consentiment mesurem l'ús de manera anonimitzada mitjançant galetes per millorar gottrix. Els teus fitxers sempre romanen en local, al teu dispositiu. Privadesa