pt

PDF OCR pesquisável

Torne um PDF digitalizado pesquisável com OCR no navegador, com uma camada de texto invisível sob as páginas originais, sem enviar nada.

Processando localmente no seu dispositivo ...

Saída
  • PDF pesquisável
  • Só texto (TXT)
Idioma do documento
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Seus arquivos

    Processando localmente no seu dispositivo ...

    0%

    Meu arquivo é enviado?

    Não. Tudo roda no seu navegador - o seu arquivo nunca sai do seu dispositivo. Como isso é verificável

    Sem envio100% local
    O conteúdo fica consigosem acesso de terceiros
    Hosted in GermanyGlobal Content Delivery
    Auditado externamenteTLS A+ · Cabeçalhos A+

    Um PDF digitalizado é, em essência, uma pilha de imagens: vê o texto, mas não consegue selecioná-lo, pesquisá-lo nem copiá-lo. O OCR (reconhecimento ótico de caracteres) lê as letras da imagem e coloca-as como uma camada de texto invisível exatamente por cima das páginas. O aspecto mantém-se idêntico, mas o PDF torna-se pesquisável e o texto selecionável, precisamente o que organismos públicos, arquivos e motores de pesquisa de texto completo precisam.

    Escolha como saída um PDF pesquisável (páginas originais com camada de texto) ou texto simples como TXT. Defina o idioma do documento na lista, 113 idiomas do português, do inglês e do alemão ao russo, ao árabe e ao hindi, passando pelo japonês, pelo coreano e pelo chinês, cada um com o seu próprio nome, para que os caracteres sejam reconhecidos corretamente. Tudo corre no navegador via WebAssembly: o mesmo motor Tesseract de código aberto da ferramenta "Imagem para texto", aplicado página a página a todo o PDF. Na primeira utilização, o navegador baixa o motor e o modelo de idioma escolhido uma única vez (poucos MB, mesma origem); depois funciona sem conexão.

    A ferramenta destina-se a PDFs digitalizados ou compostos apenas por imagens. O reconhecimento depende muito da qualidade da digitalização: páginas nítidas, direitas e com bom contraste são reconhecidas muito bem; as tortas ou desfocadas, muito pior; a escrita manual não é reconhecida de forma fiável. No PDF pesquisável cada página é reinserida como imagem, pelo que o esquema é preservado mas o arquivo pode crescer. Um PDF que já contém texto real não precisa de OCR. Verifique o resultado nos números e nos nomes próprios.

    Reconhecimento de texto costuma ser assunto de nuvem: os serviços de OCR conhecidos enviam cada digitalização para seus servidores - justamente documentos como contratos, laudos médicos ou documentos de identidade. Aqui todo o reconhecimento roda com Tesseract em WebAssembly no seu navegador, e os 113 pacotes de idioma ficam hospedados no próprio gottrix - nada é baixado de terceiros durante o reconhecimento. A lista de idiomas ainda começa pré-selecionada conforme o idioma da sua interface. Grátis, sem conta e sem limite de páginas.

    Ficha técnica

    Ficha técnica
    Formatos de entradaPDF
    Conversão automáticaPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Formatos de saídaPDF, TXT
    Processamento em loteSim
    ProcessamentoLocalmente no navegador (WebAssembly)
    Upload de arquivosNenhum

    Em 3 passos

    1. Arraste o PDF digitalizado.
    2. Escolha a saída (PDF pesquisável ou texto) e o idioma na lista.
    3. Baixe o PDF pesquisável ou o arquivo TXT.

    Limites: Para PDFs DIGITALIZADOS ou de imagens: torna-os pesquisáveis via OCR (camada de texto invisível) ou devolve texto simples. Reconhece texto IMPRESSO em 113 idiomas e muitos alfabetos; escrita manual não de forma fiável. Nota: a camada de texto invisível do PDF pesquisável abrange o alfabeto latino com todas as letras acentuadas (23 dos 113 idiomas, p. ex. polaco, checo, vietnamita, turco), o grego e o cirílico. Os caracteres de outras escritas (p. ex. CJK, árabe, hebraico, devanágari, tailandês) são aí deliberadamente omitidos em vez de saírem deturpados; para essas escritas, use a saída "Só texto (TXT)", que devolve o texto completamente reconhecido. No PDF pesquisável cada página é reinserida como imagem, o esquema preserva-se mas o arquivo pode crescer; um PDF com texto real não precisa de OCR. O reconhecimento não é perfeito: verifique especialmente os números e os nomes próprios. O motor e o modelo de idioma são baixados uma única vez (poucos MB, mesma origem), depois a ferramenta funciona sem conexão. PDFs grandes podem exigir mais tempo e memória consoante o número de páginas e o dispositivo.

    Perguntas frequentes

    Meu PDF é enviado para algum servidor?

    Não. A renderização e o reconhecimento decorrem inteiramente de forma local no navegador (WebAssembly); o PDF nunca sai do seu dispositivo, o que é a vantagem decisiva sobretudo para contratos e correspondência oficial.

    O que é um PDF pesquisável?

    A página tem o aspecto da digitalização, mas por baixo existe uma camada de texto invisível. Isso permite-lhe pesquisar no PDF, selecionar e copiar texto sem que o aspecto visual se altere.

    O esquema é preservado?

    Sim. Cada página é incorporada como imagem da página original com a camada de texto invisível alinhada por cima com precisão. O aspecto não muda, embora o arquivo possa crescer ligeiramente.

    Reconhece escrita manual ou outros idiomas?

    Outros idiomas sim: mais de 100 disponíveis, incluindo árabe, russo, hindi, japonês, coreano e chinês. A escrita manual não é reconhecida de forma fiável, apenas o texto impresso. A camada de texto do PDF pesquisável abrange o latino com todas as letras acentuadas, o grego e o cirílico; para CJK, árabe, hebraico, devanágari ou tailandês use a saída "Só texto (TXT)", que contém o texto completamente reconhecido.

    Quantos idiomas o OCR reconhece?

    113 - do português, inglês e alemão ao árabe, hindi e tailandês, até japonês, coreano e chinês. Cada idioma aparece com o próprio nome na lista, e todos os pacotes de idioma ficam hospedados no próprio gottrix, não em terceiros.

    O OCR de PDF é grátis, e existe limite de páginas?

    Sim, totalmente grátis - sem conta, sem marca d'água e sem limite de páginas ou diário. Muitas páginas apenas levam proporcionalmente mais tempo, porque é o seu próprio dispositivo que calcula o reconhecimento.

    Por que o reconhecimento local é melhor para digitalizações confidenciais?

    Porque a digitalização nunca sai do seu dispositivo: sem upload, sem processamento em servidor, sem cópia em nuvem alheia. Depois do primeiro carregamento o reconhecimento funciona até offline - a prova mais forte de que nada é transmitido.

    Ferramentas relacionadas

    Imagem para texto (OCR) · PDF para Word · Reduzir o tamanho do PDF · PDF para Markdown · PDF para texto · PDF para EPUB