sv

PDF OCR sökbar

Gör en skannad PDF sökbar med OCR - lokalt i webbläsaren, med ett osynligt textlager under originalsidorna, utan uppladdning.

Körs lokalt på din enhet ...

Utdata
  • Sökbar PDF
  • Enbart text (TXT)
Dokumentets språk
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Dina filer

    Körs lokalt på din enhet ...

    0%

    Laddas min fil upp?

    Nej. Allt körs i din webbläsare - din fil lämnar aldrig din enhet. Så går det att verifiera

    Ingen uppladdning100% lokalt
    Innehållet stannar hos digingen åtkomst för tredje part
    Hosted in GermanyGlobal Content Delivery
    Granskat externtTLS A+ · HTTP-rubriker A+

    En skannad PDF är i grunden en stapel bilder: du ser texten men kan varken markera, söka eller kopiera den. OCR (optisk teckenigenkänning) läser bokstäverna ur bilden och lägger dem som ett osynligt textlager exakt ovanpå sidorna. Utseendet förblir identiskt, men PDF:en blir sökbar och texten markerbar - precis vad myndigheter, arkiv och fulltextsökning kräver.

    Välj som utdata en sökbar PDF (originalsidor plus textlager) eller ren text som TXT. Ställ in dokumentets språk från listan - 113 språk från svenska och engelska, via ryska, arabiska och hindi, till japanska, koreanska och kinesiska, vart och ett med sitt eget namn - så att tecknen känns igen korrekt. Allt körs i webbläsaren via WebAssembly: samma öppen källkod-baserade Tesseract-motor som verktyget "Bild till text", tillämpad sida för sida på hela PDF:en. Vid första användningen laddar webbläsaren ned motorn och det valda språkmodellen en gång (några MB, same-origin); därefter fungerar det offline.

    Verktyget är avsett för skannade eller bildbaserade PDF-filer. Igenkänningskvaliteten beror starkt på skanningskvaliteten: skarpa, raka och kontrastrika sidor med tryckt text känns igen mycket väl, sneda eller suddiga sidor sämre; handstil inte tillförlitligt. I den sökbara PDF:en bäddas varje sida in på nytt som en bild, så layouten bevaras men filen kan växa. En PDF som redan innehåller riktig text behöver inte OCR-behandlas. Kontrollera resultatet för siffror och egennamn.

    Textigenkänning är annars molnets domän: kända OCR-tjänster laddar upp varje skanning till sina servrar för bearbetning - just dokument som avtal, läkarbrev eller id-handlingar. Här körs hela igenkänningen med Tesseract som WebAssembly i din webbläsare, och alla 113 språkpaket ligger självhostade på gottrix - under igenkänningen hämtas ingenting från tredje part. Språklistan startar dessutom förvald efter ditt gränssnittsspråk. Gratis, utan konto och utan sidgräns.

    Tekniska data

    Tekniska data
    IndataformatPDF
    Automatisk konverteringPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    UtdataformatPDF, TXT
    BatchbearbetningJa
    BearbetningLokalt i webbläsaren (WebAssembly)
    FiluppladdningIngen

    I 3 steg

    1. Lägg in en skannad PDF.
    2. Välj utdata (sökbar PDF eller text) och språk från listan.
    3. Ladda ned den sökbara PDF:en eller TXT.

    Begränsningar: För SKANNADE / bildbaserade PDF-filer: gör dem sökbara via OCR (osynligt textlager) eller returnerar ren text. Känner igen TRYCKT text på 113 språk och i många skriftsystem; handstil inte tillförlitligt. Obs: det osynliga textlagret i den sökbara PDF:en täcker det latinska alfabetet med alla accenttecken (23 av de 113 språken, t.ex. polska, tjeckiska, vietnamesiska, turkiska), grekiska och kyrilliska. Tecken från andra skriftsystem (t.ex. CJK, arabiska, hebreiska, devanagari, thailändska) utelämnas där medvetet i stället för att förvanskas; för dessa skriftsystem ger utdata "Enbart text (TXT)" den fullständigt igenkända texten. I den sökbara PDF:en bäddas varje sida in på nytt som en bild, så layouten bevaras men filen kan växa. En PDF med befintlig riktig text behöver inte OCR. Igenkänningen är inte felfri - kontrollera särskilt siffror och egennamn. Motor och valt språkmodell laddas ned en gång (några MB, same-origin), sedan offline-kapabel. Stora PDF-filer tar tid och minne beroende på antal sidor och enhet.

    Vanliga frågor

    Laddas min PDF upp?

    Nej. Rendering och igenkänning sker helt lokalt i webbläsaren (WebAssembly); PDF:en lämnar aldrig din enhet - de avgörande fördelarna, särskilt för kontrakt och officiell post.

    Vad är en sökbar PDF?

    Sidan ser ut som skanningen, men under ytan finns ett osynligt textlager. Det gör att du kan söka i PDF:en, markera och kopiera text - medan det visuella intrycket förblir detsamma.

    Bevaras layouten?

    Ja. Varje sida bäddas in som en bild av originalsidan, med det osynliga textlagret exakt ovanpå. Utseendet ändras inte, men filen kan bli något större.

    Känner det igen handstil eller andra språk?

    Andra språk ja: över 100 finns tillgängliga (inklusive arabiska, ryska, hindi, japanska, koreanska, kinesiska). Handstil känns inte igen tillförlitligt, bara tryckt text. Textlagret i den sökbara PDF:en täcker det latinska alfabetet med alla accenttecken, grekiska och kyrilliska; för CJK, arabiska, hebreiska, devanagari eller thailändska använd utdata "Enbart text (TXT)", som innehåller den fullständigt igenkända texten.

    Hur många språk känner textigenkänningen igen?

    113 - från svenska, engelska och tyska via arabiska, hindi och thai till japanska, koreanska och kinesiska. Varje språk står under sitt eget namn i listan, och alla språkpaket ligger på gottrix självt, inte hos någon tredje part.

    Är PDF-OCR gratis, och finns det en sidgräns?

    Ja, helt gratis - utan konto, utan vattenstämpel och utan sid- eller dagsgräns. Många sidor tar bara motsvarande längre tid, eftersom din egen enhet räknar ut igenkänningen.

    Varför är lokal textigenkänning bättre för konfidentiella skanningar?

    Därför att skanningen aldrig lämnar din enhet: ingen uppladdning, ingen serverbearbetning, ingen kopia i någon annans moln. Efter första laddningen fungerar igenkänningen till och med offline - det starkaste beviset på att inget skickas.

    Relaterade verktyg

    Bild till text (OCR) · PDF till Word · Komprimera PDF · PDF till Markdown · PDF till text · PDF till EPUB