Innehållet stannar hos digingen åtkomst för tredje part
Ditt filinnehåll behandlas inte på någon server. Du behöver inget personuppgiftsbiträdesavtal med gottrix för att hantera konfidentiella eller affärsdokument.
Hosted in GermanyGlobal Content Delivery
Origin-servrar hos Hetzner i Tyskland, global leverans via ett content delivery network (CDN). Ditt filinnehåll överförs aldrig i processen - det lämnar aldrig din enhet.
En skannad PDF är i grunden en stapel bilder: du ser texten men kan varken markera, söka eller kopiera den. OCR (optisk teckenigenkänning) läser bokstäverna ur bilden och lägger dem som ett osynligt textlager exakt ovanpå sidorna. Utseendet förblir identiskt, men PDF:en blir sökbar och texten markerbar - precis vad myndigheter, arkiv och fulltextsökning kräver.
Välj som utdata en sökbar PDF (originalsidor plus textlager) eller ren text som TXT. Ställ in dokumentets språk från listan - 113 språk från svenska och engelska, via ryska, arabiska och hindi, till japanska, koreanska och kinesiska, vart och ett med sitt eget namn - så att tecknen känns igen korrekt. Allt körs i webbläsaren via WebAssembly: samma öppen källkod-baserade Tesseract-motor som verktyget "Bild till text", tillämpad sida för sida på hela PDF:en. Vid första användningen laddar webbläsaren ned motorn och det valda språkmodellen en gång (några MB, same-origin); därefter fungerar det offline.
Verktyget är avsett för skannade eller bildbaserade PDF-filer. Igenkänningskvaliteten beror starkt på skanningskvaliteten: skarpa, raka och kontrastrika sidor med tryckt text känns igen mycket väl, sneda eller suddiga sidor sämre; handstil inte tillförlitligt. I den sökbara PDF:en bäddas varje sida in på nytt som en bild, så layouten bevaras men filen kan växa. En PDF som redan innehåller riktig text behöver inte OCR-behandlas. Kontrollera resultatet för siffror och egennamn.
Textigenkänning är annars molnets domän: kända OCR-tjänster laddar upp varje skanning till sina servrar för bearbetning - just dokument som avtal, läkarbrev eller id-handlingar. Här körs hela igenkänningen med Tesseract som WebAssembly i din webbläsare, och alla 113 språkpaket ligger självhostade på gottrix - under igenkänningen hämtas ingenting från tredje part. Språklistan startar dessutom förvald efter ditt gränssnittsspråk. Gratis, utan konto och utan sidgräns.
Välj utdata (sökbar PDF eller text) och språk från listan.
Ladda ned den sökbara PDF:en eller TXT.
Begränsningar: För SKANNADE / bildbaserade PDF-filer: gör dem sökbara via OCR (osynligt textlager) eller returnerar ren text. Känner igen TRYCKT text på 113 språk och i många skriftsystem; handstil inte tillförlitligt. Obs: det osynliga textlagret i den sökbara PDF:en täcker det latinska alfabetet med alla accenttecken (23 av de 113 språken, t.ex. polska, tjeckiska, vietnamesiska, turkiska), grekiska och kyrilliska. Tecken från andra skriftsystem (t.ex. CJK, arabiska, hebreiska, devanagari, thailändska) utelämnas där medvetet i stället för att förvanskas; för dessa skriftsystem ger utdata "Enbart text (TXT)" den fullständigt igenkända texten. I den sökbara PDF:en bäddas varje sida in på nytt som en bild, så layouten bevaras men filen kan växa. En PDF med befintlig riktig text behöver inte OCR. Igenkänningen är inte felfri - kontrollera särskilt siffror och egennamn. Motor och valt språkmodell laddas ned en gång (några MB, same-origin), sedan offline-kapabel. Stora PDF-filer tar tid och minne beroende på antal sidor och enhet.
Vanliga frågor
Laddas min PDF upp?
Nej. Rendering och igenkänning sker helt lokalt i webbläsaren (WebAssembly); PDF:en lämnar aldrig din enhet - de avgörande fördelarna, särskilt för kontrakt och officiell post.
Vad är en sökbar PDF?
Sidan ser ut som skanningen, men under ytan finns ett osynligt textlager. Det gör att du kan söka i PDF:en, markera och kopiera text - medan det visuella intrycket förblir detsamma.
Bevaras layouten?
Ja. Varje sida bäddas in som en bild av originalsidan, med det osynliga textlagret exakt ovanpå. Utseendet ändras inte, men filen kan bli något större.
Känner det igen handstil eller andra språk?
Andra språk ja: över 100 finns tillgängliga (inklusive arabiska, ryska, hindi, japanska, koreanska, kinesiska). Handstil känns inte igen tillförlitligt, bara tryckt text. Textlagret i den sökbara PDF:en täcker det latinska alfabetet med alla accenttecken, grekiska och kyrilliska; för CJK, arabiska, hebreiska, devanagari eller thailändska använd utdata "Enbart text (TXT)", som innehåller den fullständigt igenkända texten.
Hur många språk känner textigenkänningen igen?
113 - från svenska, engelska och tyska via arabiska, hindi och thai till japanska, koreanska och kinesiska. Varje språk står under sitt eget namn i listan, och alla språkpaket ligger på gottrix självt, inte hos någon tredje part.
Är PDF-OCR gratis, och finns det en sidgräns?
Ja, helt gratis - utan konto, utan vattenstämpel och utan sid- eller dagsgräns. Många sidor tar bara motsvarande längre tid, eftersom din egen enhet räknar ut igenkänningen.
Varför är lokal textigenkänning bättre för konfidentiella skanningar?
Därför att skanningen aldrig lämnar din enhet: ingen uppladdning, ingen serverbearbetning, ingen kopia i någon annans moln. Efter första laddningen fungerar igenkänningen till och med offline - det starkaste beviset på att inget skickas.
Endast med ditt samtycke mäter vi användningen anonymiserat via cookies för att förbättra gottrix. Dina filer stannar alltid lokalt, på din enhet. Integritet