zh-Hant

PDF OCR 可搜尋轉換

用OCR讓掃描PDF變為可搜尋 - 在瀏覽器本地處理,於原始頁面下方加入不可見文字層,無需上傳。

正在你的裝置上本機處理 ...

輸出格式
  • 可搜尋PDF
  • 僅文字 (TXT)
文件語言
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

你的檔案

    正在你的裝置上本機處理 ...

    0%

    我的檔案會被上傳嗎?

    不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證

    無需上傳100% 本機處理
    內容只留在你這裡第三方無法存取
    Hosted in GermanyGlobal Content Delivery
    通過獨立稽核TLS A+ · 標頭 A+

    掃描PDF本質上是一疊圖片:您能看見文字,卻無法選取、搜尋或複製。OCR(光學字元辨識)從圖片中讀取文字,並將其以不可見文字層精確疊加在每一頁上。外觀完全不變,但PDF變得可以搜尋,文字也可以選取。這正是政府機關、檔案室和全文搜尋系統所期望的標準格式。

    輸出格式可選:可搜尋PDF(原始頁面加文字層)或TXT純文字。從清單中設定文件語言,支援113種語言,從德語、英語、俄語、阿拉伯語、印地語到日語、韓語和中文,每種語言均以自身名稱顯示。所有處理均透過WebAssembly在瀏覽器中執行:與「圖片辨識文字」工具相同的開源Tesseract引擎,逐頁套用於整個PDF。首次使用時瀏覽器一次性下載引擎和所選語言模型(數MB,同源);之後離線可用。

    本工具適用於掃描或圖片型PDF。辨識品質高度依賴掃描品質:清晰、端正且對比高的印刷頁面辨識效果極佳,傾斜或模糊的頁面效果較差;手寫文字無法可靠辨識。在可搜尋PDF中,每頁會以圖片形式重新嵌入,因此已含真實文字的PDF無需OCR處理。請核查數字和專有名詞的辨識結果。

    文字辨識通常是雲端的領地:知名OCR服務會把每份掃描檔上傳到自己的伺服器處理 - 偏偏是合約、醫療報告或證件這類文件。在這裡,整個辨識過程由編譯成WebAssembly的Tesseract在你的瀏覽器裡完成,全部113個語言包都託管在gottrix自己的伺服器上 - 辨識過程中不會從第三方載入任何內容。語言清單還會根據你的介面語言預先選好。免費、無需帳戶、頁數不限。

    技術規格

    技術規格
    輸入格式PDF
    自動轉換PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    輸出格式PDF, TXT
    批次處理支援
    處理方式在瀏覽器中本機處理 (WebAssembly)
    檔案上傳

    三個步驟

    1. 拖入掃描PDF。
    2. 選擇輸出格式(可搜尋PDF或文字)及文件語言。
    3. 下載可搜尋PDF或TXT。

    限制: 適用於掃描/圖片型PDF:透過OCR使其可搜尋(不可見文字層)或輸出純文字。可辨識113種語言及多種文字系統的印刷文字;手寫文字無法可靠辨識。注意:可搜尋PDF中的不可見文字層支援帶全部變音符號的拉丁字母(113種語言中的23種,如波蘭文、捷克文、越南文、土耳其文)、希臘文和西里爾文。其他文字系統的字元(如CJK、阿拉伯文、希伯來文、天城文、泰文)會被刻意略去,而不是以亂碼形式嵌入;對於這些文字系統,請使用「僅文字(TXT)」輸出。可搜尋PDF中每頁以圖片形式重新嵌入,版面保留但檔案可能變大;已含真實文字的PDF無需OCR。辨識並非完全準確,請特別核查數字和專有名詞。引擎和語言模型一次性下載(數MB,同源),之後可離線使用。大型PDF因頁數和裝置不同,處理時間和記憶體用量會有所不同。

    常見問題

    我的PDF會被上傳嗎?

    不會。算繪和文字辨識完全在瀏覽器本地執行(WebAssembly),PDF不會離開您的裝置。處理合約和公文時尤為重要。

    什麼是可搜尋PDF?

    頁面看起來與掃描原件相同,但其下方有一個不可見的文字層。這樣您就可以在PDF中搜尋、選取和複製文字,視覺效果保持不變。

    版面配置會保留嗎?

    會。每頁以原始頁面的圖片形式重新嵌入,不可見文字層精確疊加其上。外觀不變,但檔案大小可能略有增加。

    能辨識手寫或其他語言嗎?

    其他語言可以:支援100種以上語言(包含阿拉伯語、俄語、印地語、日語、韓語、中文等)。手寫文字無法可靠辨識,僅支援印刷文字。可搜尋PDF文字層支援帶全部變音符號的拉丁字母、希臘文和西里爾文;遇到CJK、阿拉伯文、希伯來文、天城文或泰文時,請使用包含完整辨識文字的「僅文字(TXT)」輸出。

    文字辨識支援多少種語言?

    113種 - 從中文、英語、德語,到阿拉伯語、印地語、泰語,再到日語和韓語。每種語言都以其本族名稱顯示在清單中,所有語言包都託管在gottrix自己這裡,不在第三方。

    PDF OCR免費嗎?有頁數限制嗎?

    是的,完全免費 - 無需帳戶、無浮水印、沒有頁數或每日限制。頁數很多只是相應更耗時,因為辨識是由你自己的裝置計算的。

    為什麼本機文字辨識更適合機密掃描檔?

    因為掃描檔永遠不會離開你的裝置:不上傳、不經伺服器處理、不會在別人的雲端留下副本。首次載入後辨識甚至可以離線執行 - 這是什麼都沒有被傳輸的最有力證明。

    相關工具

    圖片辨識文字 (OCR) · PDF轉Word · 壓縮 PDF · PDF轉Markdown文件 · PDF 轉文字 · PDF轉EPUB