Não há qualquer subcontratação no tratamento do conteúdo dos seus arquivos. Não precisa de um contrato de tratamento de dados com a gottrix para processar documentos confidenciais ou empresariais.
Hosted in GermanyGlobal Content Delivery
Servidores de origem na Hetzner, na Alemanha, com entrega mundial por meio de uma rede de distribuição de conteúdo (CDN). O conteúdo dos seus arquivos nunca é transmitido nesse processo - ele não sai do seu dispositivo.
Markdown é o formato de referência para notas, wikis, sites estáticos e ferramentas de IA: simples, versionável e legível em qualquer lugar. Quem quer reutilizar o conteúdo de um PDF tem de o copiar laboriosamente. Esta ferramenta lê a camada de texto do PDF e devolve-a como Markdown com a estrutura geral já definida - títulos, listas e parágrafos em vez de um único bloco de texto.
A estrutura é detectada por heurística: as linhas com um tamanho de fonte notavelmente maior do que o corpo do texto tornam-se títulos (#, ## ou ###), as linhas que começam com um marcador ou número são convertidas em listas Markdown, e um espaçamento vertical maior entre linhas indica um novo parágrafo. A partir das posições do texto bruto obtém-se um documento Markdown legível e reutilizável - um ponto de partida ideal a aperfeiçoar no seu editor.
Honesto e importante: trata-se de uma aproximação estrutural, não de uma reconstrução fiel do layout. Tabelas, páginas com múltiplas colunas e formatações detalhadas não podem ser derivadas sem perda da camada de texto. Como na extração de texto simples: um PDF digitalizado ou composto apenas por imagens não tem camada de texto - o resultado ficará vazio e será necessário usar o reconhecimento de texto PDF OCR. Tudo é executado localmente no navegador via pdf.js; o seu arquivo não sai do seu dispositivo.
Limites: Converte a camada de texto existente de um PDF em Markdown (UTF-8 .md). Títulos, listas e parágrafos são detectados heuristicamente pelo tamanho da fonte e espaçamento - uma aproximação estrutural, não uma reconstrução exata do layout. Tabelas e páginas com múltiplas colunas são apenas aproximadas linearmente. PDFs digitalizados ou compostos apenas por imagens não têm camada de texto; o resultado fica vazio, use PDF OCR. Desbloqueie primeiro os PDFs protegidos por senha. Somente o texto é lido (getTextContent do pdf.js); imagens incorporadas não são levadas para o Markdown.
Perguntas frequentes
Como são detectados os títulos?
Pelo tamanho da fonte: as linhas notavelmente maiores do que o corpo do texto tornam-se #, ## ou ### conforme a proporção.
As tabelas e colunas são preservadas?
Não. A conversão é uma aproximação estrutural; tabelas e layouts com múltiplas colunas são apenas aproximados linearmente, sem reconstrução fiel.
Por que está vazio meu Markdown?
O seu PDF é provavelmente uma digitalização ou é composto por imagens e não tem camada de texto. Use PDF OCR, que reconhece o texto a partir dos pixels.
O PDF é enviado para um servidor?
Não. A conversão é executada inteiramente de forma local no navegador via pdf.js; o arquivo não sai do seu dispositivo.
Apenas com o seu consentimento medimos a utilização de forma anonimizada através de cookies para melhorar o gottrix. Os seus arquivos permanecem sempre locais, no seu dispositivo. Privacidade