Não há qualquer subcontratação no tratamento do conteúdo dos seus arquivos. Não precisa de um contrato de tratamento de dados com a gottrix para processar documentos confidenciais ou empresariais.
Hosted in GermanyGlobal Content Delivery
Servidores de origem na Hetzner, na Alemanha, com entrega mundial por meio de uma rede de distribuição de conteúdo (CDN). O conteúdo dos seus arquivos nunca é transmitido nesse processo - ele não sai do seu dispositivo.
Um PDF digitalizado é, em essência, uma pilha de imagens: vê o texto, mas não consegue selecioná-lo, pesquisá-lo nem copiá-lo. O OCR (reconhecimento ótico de caracteres) lê as letras da imagem e coloca-as como uma camada de texto invisível exatamente por cima das páginas. O aspecto mantém-se idêntico, mas o PDF torna-se pesquisável e o texto selecionável, precisamente o que organismos públicos, arquivos e motores de pesquisa de texto completo precisam.
Escolha como saída um PDF pesquisável (páginas originais com camada de texto) ou texto simples como TXT. Defina o idioma do documento na lista, 113 idiomas do português, do inglês e do alemão ao russo, ao árabe e ao hindi, passando pelo japonês, pelo coreano e pelo chinês, cada um com o seu próprio nome, para que os caracteres sejam reconhecidos corretamente. Tudo corre no navegador via WebAssembly: o mesmo motor Tesseract de código aberto da ferramenta "Imagem para texto", aplicado página a página a todo o PDF. Na primeira utilização, o navegador baixa o motor e o modelo de idioma escolhido uma única vez (poucos MB, mesma origem); depois funciona sem conexão.
A ferramenta destina-se a PDFs digitalizados ou compostos apenas por imagens. O reconhecimento depende muito da qualidade da digitalização: páginas nítidas, direitas e com bom contraste são reconhecidas muito bem; as tortas ou desfocadas, muito pior; a escrita manual não é reconhecida de forma fiável. No PDF pesquisável cada página é reinserida como imagem, pelo que o esquema é preservado mas o arquivo pode crescer. Um PDF que já contém texto real não precisa de OCR. Verifique o resultado nos números e nos nomes próprios.
Reconhecimento de texto costuma ser assunto de nuvem: os serviços de OCR conhecidos enviam cada digitalização para seus servidores - justamente documentos como contratos, laudos médicos ou documentos de identidade. Aqui todo o reconhecimento roda com Tesseract em WebAssembly no seu navegador, e os 113 pacotes de idioma ficam hospedados no próprio gottrix - nada é baixado de terceiros durante o reconhecimento. A lista de idiomas ainda começa pré-selecionada conforme o idioma da sua interface. Grátis, sem conta e sem limite de páginas.
Escolha a saída (PDF pesquisável ou texto) e o idioma na lista.
Baixe o PDF pesquisável ou o arquivo TXT.
Limites: Para PDFs DIGITALIZADOS ou de imagens: torna-os pesquisáveis via OCR (camada de texto invisível) ou devolve texto simples. Reconhece texto IMPRESSO em 113 idiomas e muitos alfabetos; escrita manual não de forma fiável. Nota: a camada de texto invisível do PDF pesquisável abrange o alfabeto latino com todas as letras acentuadas (23 dos 113 idiomas, p. ex. polaco, checo, vietnamita, turco), o grego e o cirílico. Os caracteres de outras escritas (p. ex. CJK, árabe, hebraico, devanágari, tailandês) são aí deliberadamente omitidos em vez de saírem deturpados; para essas escritas, use a saída "Só texto (TXT)", que devolve o texto completamente reconhecido. No PDF pesquisável cada página é reinserida como imagem, o esquema preserva-se mas o arquivo pode crescer; um PDF com texto real não precisa de OCR. O reconhecimento não é perfeito: verifique especialmente os números e os nomes próprios. O motor e o modelo de idioma são baixados uma única vez (poucos MB, mesma origem), depois a ferramenta funciona sem conexão. PDFs grandes podem exigir mais tempo e memória consoante o número de páginas e o dispositivo.
Perguntas frequentes
Meu PDF é enviado para algum servidor?
Não. A renderização e o reconhecimento decorrem inteiramente de forma local no navegador (WebAssembly); o PDF nunca sai do seu dispositivo, o que é a vantagem decisiva sobretudo para contratos e correspondência oficial.
O que é um PDF pesquisável?
A página tem o aspecto da digitalização, mas por baixo existe uma camada de texto invisível. Isso permite-lhe pesquisar no PDF, selecionar e copiar texto sem que o aspecto visual se altere.
O esquema é preservado?
Sim. Cada página é incorporada como imagem da página original com a camada de texto invisível alinhada por cima com precisão. O aspecto não muda, embora o arquivo possa crescer ligeiramente.
Reconhece escrita manual ou outros idiomas?
Outros idiomas sim: mais de 100 disponíveis, incluindo árabe, russo, hindi, japonês, coreano e chinês. A escrita manual não é reconhecida de forma fiável, apenas o texto impresso. A camada de texto do PDF pesquisável abrange o latino com todas as letras acentuadas, o grego e o cirílico; para CJK, árabe, hebraico, devanágari ou tailandês use a saída "Só texto (TXT)", que contém o texto completamente reconhecido.
Quantos idiomas o OCR reconhece?
113 - do português, inglês e alemão ao árabe, hindi e tailandês, até japonês, coreano e chinês. Cada idioma aparece com o próprio nome na lista, e todos os pacotes de idioma ficam hospedados no próprio gottrix, não em terceiros.
O OCR de PDF é grátis, e existe limite de páginas?
Sim, totalmente grátis - sem conta, sem marca d'água e sem limite de páginas ou diário. Muitas páginas apenas levam proporcionalmente mais tempo, porque é o seu próprio dispositivo que calcula o reconhecimento.
Por que o reconhecimento local é melhor para digitalizações confidenciais?
Porque a digitalização nunca sai do seu dispositivo: sem upload, sem processamento em servidor, sem cópia em nuvem alheia. Depois do primeiro carregamento o reconhecimento funciona até offline - a prova mais forte de que nada é transmitido.
Apenas com o seu consentimento medimos a utilização de forma anonimizada através de cookies para melhorar o gottrix. Os seus arquivos permanecem sempre locais, no seu dispositivo. Privacidade