Er vindt geen verwerking van je bestandsinhoud op een server plaats. Je hebt geen verwerkersovereenkomst met gottrix nodig om vertrouwelijke of zakelijke documenten te bewerken.
Hosted in GermanyGlobal Content Delivery
Origin-servers bij Hetzner in Duitsland, wereldwijde levering via een content delivery network (CDN). De inhoud van je bestanden wordt daarbij nooit verzonden - die verlaat je apparaat niet.
Een gescande PDF is in wezen een stapel afbeeldingen: je ziet de tekst, maar kunt hem niet selecteren, doorzoeken of kopiëren. OCR (optische tekenherkenning) leest de letters uit de afbeelding en plaatst ze als onzichtbare tekstlaag precies over de pagina's. Het uiterlijk blijft identiek, maar de PDF wordt doorzoekbaar en de tekst selecteerbaar - precies wat overheden, archieven en zoekfuncties verwachten.
Kies als uitvoer een doorzoekbare PDF (originele pagina's plus tekstlaag) of platte tekst als TXT. Stel de documenttaal in via de lijst - 113 talen, van Nederlands en Engels tot Russisch, Arabisch en Hindi, en verder naar Japans, Koreaans en Chinees, elk in zijn eigen naam - zodat de tekens correct worden herkend. Alles draait in de browser via WebAssembly: dezelfde open-source Tesseract-engine als de tool "Afbeelding naar tekst", maar nu pagina voor pagina op de hele PDF toegepast. Bij eerste gebruik downloadt de browser engine en taalmodel eenmalig (enkele MB, same-origin); daarna offline beschikbaar.
De tool is bedoeld voor gescande of op afbeeldingen gebaseerde PDF's. De herkenning hangt sterk af van de scankwaliteit: scherpe, rechte en contrastrijke pagina's met gedrukte tekst worden zeer goed herkend, scheve of wazige veel slechter; handschrift niet betrouwbaar. In de doorzoekbare PDF wordt elke pagina als afbeelding opnieuw ingesloten, zodat de lay-out bewaard blijft maar het bestand wat groter kan worden. Een PDF die al echte tekst bevat heeft geen OCR nodig. Controleer het resultaat op cijfers en eigennamen.
Tekstherkenning is normaal een domein van de cloud: bekende OCR-diensten uploaden elke scan naar hun servers voor verwerking - uitgerekend documenten als contracten, medische brieven of identiteitsbewijzen. Hier draait de complete herkenning met Tesseract als WebAssembly in je browser, en alle 113 taalpakketten worden op gottrix zelf gehost - tijdens het herkennen wordt niets van derden geladen. De talenlijst start bovendien voorgeselecteerd op de taal van je interface. Gratis, zonder account en zonder paginalimiet.
Kies de uitvoer (doorzoekbare PDF of tekst) en de taal uit de lijst.
Download de doorzoekbare PDF of TXT.
Beperkingen: Voor GESCANDE / afbeeldings-PDF's: maakt ze doorzoekbaar via OCR (onzichtbare tekstlaag) of geeft platte tekst terug. Herkent GEDRUKTE tekst in 113 talen en veel schriften; handschrift niet betrouwbaar. Let op: de onzichtbare tekstlaag in de doorzoekbare PDF omvat het Latijnse schrift met alle accentletters (23 van de 113 talen, bijv. Pools, Tsjechisch, Vietnamees, Turks), Grieks en Cyrillisch. Tekens uit andere schriften (bijv. CJK, Arabisch, Hebreeuws, Devanagari, Thai) worden daar bewust weggelaten in plaats van verminkt; gebruik voor die schriften de uitvoer "Alleen tekst (TXT)" voor de volledig herkende tekst. In de doorzoekbare PDF wordt elke pagina als afbeelding opnieuw ingesloten, zodat de lay-out bewaard blijft maar het bestand groter kan worden. Een PDF met al echte tekst heeft geen OCR nodig. Herkenning is niet foutloos - controleer vooral cijfers en eigennamen. Engine + taalmodel worden eenmalig gedownload (enkele MB, same-origin), daarna offline bruikbaar. Grote PDF's kosten tijd en geheugen afhankelijk van het aantal pagina's en het apparaat.
Veelgestelde vragen
Wordt mijn PDF geüpload?
Nee. Weergave en tekstherkenning verlopen volledig lokaal in de browser (WebAssembly); de PDF verlaat je apparaat niet - juist bij contracten en officiële post het doorslaggevende voordeel.
Wat is een doorzoekbare PDF?
De pagina ziet eruit zoals de scan, maar daaronder zit een onzichtbare tekstlaag. Hierdoor kun je in de PDF zoeken, tekst selecteren en kopiëren - terwijl het uiterlijk hetzelfde blijft.
Blijft de lay-out bewaard?
Ja. Elke pagina wordt als afbeelding van de originele pagina ingesloten, met de onzichtbare tekstlaag er precies overheen. Het uiterlijk verandert niet, maar het bestand kan iets groter worden.
Herkent het handschrift of andere talen?
Andere talen wel: meer dan 100 zijn beschikbaar (ook Arabisch, Russisch, Hindi, Japans, Koreaans, Chinees). Handschrift wordt niet betrouwbaar herkend, alleen gedrukte tekst. De tekstlaag in de doorzoekbare PDF omvat het Latijnse schrift met alle accentletters, Grieks en Cyrillisch; gebruik voor CJK, Arabisch, Hebreeuws, Devanagari of Thai de uitvoer "Alleen tekst (TXT)", die de volledig herkende tekst bevat.
Hoeveel talen herkent de tekstherkenning?
113 - van Nederlands, Engels en Duits via Arabisch, Hindi en Thai tot Japans, Koreaans en Chinees. Elke taal staat onder haar eigen naam in de lijst, en alle taalpakketten worden op gottrix zelf gehost, niet bij een derde partij.
Is PDF-OCR gratis, en is er een paginalimiet?
Ja, volledig gratis - zonder account, zonder watermerk en zonder pagina- of daglimiet. Heel veel pagina's kosten alleen navenant meer tijd, omdat je eigen apparaat de herkenning uitrekent.
Waarom is lokale tekstherkenning beter voor vertrouwelijke scans?
Omdat de scan je apparaat nooit verlaat: geen upload, geen serververwerking, geen kopie in een vreemde cloud. Na de eerste keer laden werkt de herkenning zelfs offline - het sterkste bewijs dat er niets wordt verzonden.
Alleen met je toestemming meten we het gebruik geanonimiseerd via cookies om gottrix te verbeteren. Je bestanden blijven altijd lokaal, op jouw apparaat. Privacy