Não há qualquer subcontratação no tratamento do conteúdo dos seus arquivos. Não precisa de um contrato de tratamento de dados com a gottrix para processar documentos confidenciais ou empresariais.
Hosted in GermanyGlobal Content Delivery
Servidores de origem na Hetzner, na Alemanha, com entrega mundial por meio de uma rede de distribuição de conteúdo (CDN). O conteúdo dos seus arquivos nunca é transmitido nesse processo - ele não sai do seu dispositivo.
Os números costumam ficar presos justamente onde não podem ser aproveitados: nas tabelas de um PDF. Notas fiscais, relatórios, extratos bancários, estudos: quem precisa desses valores no Excel, em um banco de dados ou em um script até agora digitava tudo de novo ou brigava com colunas que desmontam ao colar. Esta ferramenta reconhece as tabelas do PDF automaticamente e as exporta com a estrutura preservada: como CSV para planilhas e importações, como pasta de trabalho do Excel (XLSX) com uma planilha por tabela ou como JSON com coordenadas para processar em código.
A detecção usa as duas mesmas técnicas das ferramentas especializadas conhecidas: tabelas com bordas são reconhecidas pelas linhas realmente desenhadas na página (modo grade); as linhas formam a grade de células e cada texto é atribuído à sua célula. Tabelas sem bordas são reconhecidas pelo alinhamento (modo espaços): blocos de texto que aparecem nas mesmas posições de coluna ao longo de várias linhas formam as colunas, e os vãos contínuos marcam os limites. O modo automático procura primeiro por linhas e, se não houver, analisa os espaços; os dois modos também podem ser forçados. Várias tabelas e PDFs de várias páginas são suportados: cada tabela detectada é exportada separadamente.
Honesto e importante: a detecção lê a camada de texto do PDF. Um PDF escaneado, ou feito só de imagens, não tem essa camada; nesse caso a ferramenta avisa abertamente, em vez de produzir tabelas vazias ou inventadas. Converta os escaneados primeiro com "PDF OCR" e extraia as tabelas depois. Layouts complexos têm limites: células mescladas ou tabelas aninhadas são aproximadas, não reconstruídas pixel a pixel. Tudo roda localmente no navegador via pdf.js; seu arquivo nunca sai do seu dispositivo.
Ficha técnica
Ficha técnica
Formatos de entrada
PDF
Conversão automática
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Formatos de saída
CSV, XLSX, JSON
Processamento em lote
Não
Processamento
Localmente no navegador (JavaScript)
Upload de arquivos
Nenhum
Em 3 passos
Solte o seu PDF.
Escolha o formato de saída e a detecção.
Baixe as tabelas como CSV, XLSX ou JSON.
Limites: Detecta tabelas pelas linhas de borda (grade) ou pelo alinhamento do texto (espaços) e as exporta como CSV (um arquivo por tabela, várias em um ZIP), XLSX (uma planilha por tabela) ou JSON (com página, células e posições em pontos PDF). Exige uma camada de texto real: converta antes os PDFs escaneados com "PDF OCR". Células mescladas e layouts complexos são aproximados; no Excel, apenas números inequívocos (decimal com ponto) viram células numéricas. Abra antes os PDFs protegidos com "Desbloquear PDF".
Perguntas frequentes
Como a ferramenta detecta as tabelas?
Com duas técnicas: em tabelas com bordas, as linhas desenhadas formam a grade de células (modo grade). Em tabelas sem bordas, as colunas são reconhecidas pelo alinhamento do texto e pelos vãos contínuos (modo espaços). O modo automático escolhe a técnica certa sozinho.
Por que não encontra tabelas no meu documento escaneado?
Um documento escaneado é só pixels de imagem, sem camada de texto para ler. Converta o PDF primeiro em texto pesquisável com "PDF OCR" e depois extraia as tabelas.
Posso exportar várias tabelas e páginas de uma vez?
Sim. Todas as páginas são percorridas e cada tabela detectada é exportada separadamente: como arquivo CSV próprio (vários agrupados em um ZIP), como planilha própria em um arquivo Excel ou como entrada no JSON.
O que a exportação JSON contém?
A estrutura completa: por tabela, a página, o modo de detecção e a posição; por célula, o texto e a caixa delimitadora em pontos PDF (origem embaixo à esquerda). Ideal para scripts e pipelines de dados.
Por que células mescladas não saem exatas?
Uma célula mesclada sobre várias colunas não tem posição única na grade; o conteúdo cai em uma das células envolvidas e as outras ficam vazias. É uma aproximação honesta: nem as ferramentas de desktop especializadas resolvem isso sem falhas.
O PDF é enviado para algum servidor?
Não. A detecção e a exportação rodam totalmente no navegador via pdf.js; o arquivo nunca sai do seu dispositivo.
A extração de tabelas funciona também no celular ou Chromebook?
Sim, em qualquer dispositivo com navegador atual - Windows, Mac, Linux, Chromebook ou celular. PDFs muito grandes só precisam de mais tempo e memória em dispositivos móveis.
Apenas com o seu consentimento medimos a utilização de forma anonimizada através de cookies para melhorar o gottrix. Os seus arquivos permanecem sempre locais, no seu dispositivo. Privacidade