PDF OCR 可搜尋轉換
用OCR讓掃描PDF變為可搜尋 - 在瀏覽器本地處理,於原始頁面下方加入不可見文字層,無需上傳。
正在你的裝置上本機處理 ...
你的檔案
正在你的裝置上本機處理 ...
0%
我的檔案會被上傳嗎?
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
用OCR讓掃描PDF變為可搜尋 - 在瀏覽器本地處理,於原始頁面下方加入不可見文字層,無需上傳。
正在你的裝置上本機處理 ...
正在你的裝置上本機處理 ...
0%
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
掃描PDF本質上是一疊圖片:您能看見文字,卻無法選取、搜尋或複製。OCR(光學字元辨識)從圖片中讀取文字,並將其以不可見文字層精確疊加在每一頁上。外觀完全不變,但PDF變得可以搜尋,文字也可以選取。這正是政府機關、檔案室和全文搜尋系統所期望的標準格式。
輸出格式可選:可搜尋PDF(原始頁面加文字層)或TXT純文字。從清單中設定文件語言,支援113種語言,從德語、英語、俄語、阿拉伯語、印地語到日語、韓語和中文,每種語言均以自身名稱顯示。所有處理均透過WebAssembly在瀏覽器中執行:與「圖片辨識文字」工具相同的開源Tesseract引擎,逐頁套用於整個PDF。首次使用時瀏覽器一次性下載引擎和所選語言模型(數MB,同源);之後離線可用。
本工具適用於掃描或圖片型PDF。辨識品質高度依賴掃描品質:清晰、端正且對比高的印刷頁面辨識效果極佳,傾斜或模糊的頁面效果較差;手寫文字無法可靠辨識。在可搜尋PDF中,每頁會以圖片形式重新嵌入,因此已含真實文字的PDF無需OCR處理。請核查數字和專有名詞的辨識結果。
文字辨識通常是雲端的領地:知名OCR服務會把每份掃描檔上傳到自己的伺服器處理 - 偏偏是合約、醫療報告或證件這類文件。在這裡,整個辨識過程由編譯成WebAssembly的Tesseract在你的瀏覽器裡完成,全部113個語言包都託管在gottrix自己的伺服器上 - 辨識過程中不會從第三方載入任何內容。語言清單還會根據你的介面語言預先選好。免費、無需帳戶、頁數不限。
| 輸入格式 | |
|---|---|
| 自動轉換 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 輸出格式 | PDF, TXT |
| 批次處理 | 支援 |
| 處理方式 | 在瀏覽器中本機處理 (WebAssembly) |
| 檔案上傳 | 無 |
限制: 適用於掃描/圖片型PDF:透過OCR使其可搜尋(不可見文字層)或輸出純文字。可辨識113種語言及多種文字系統的印刷文字;手寫文字無法可靠辨識。注意:可搜尋PDF中的不可見文字層支援帶全部變音符號的拉丁字母(113種語言中的23種,如波蘭文、捷克文、越南文、土耳其文)、希臘文和西里爾文。其他文字系統的字元(如CJK、阿拉伯文、希伯來文、天城文、泰文)會被刻意略去,而不是以亂碼形式嵌入;對於這些文字系統,請使用「僅文字(TXT)」輸出。可搜尋PDF中每頁以圖片形式重新嵌入,版面保留但檔案可能變大;已含真實文字的PDF無需OCR。辨識並非完全準確,請特別核查數字和專有名詞。引擎和語言模型一次性下載(數MB,同源),之後可離線使用。大型PDF因頁數和裝置不同,處理時間和記憶體用量會有所不同。
不會。算繪和文字辨識完全在瀏覽器本地執行(WebAssembly),PDF不會離開您的裝置。處理合約和公文時尤為重要。
頁面看起來與掃描原件相同,但其下方有一個不可見的文字層。這樣您就可以在PDF中搜尋、選取和複製文字,視覺效果保持不變。
會。每頁以原始頁面的圖片形式重新嵌入,不可見文字層精確疊加其上。外觀不變,但檔案大小可能略有增加。
其他語言可以:支援100種以上語言(包含阿拉伯語、俄語、印地語、日語、韓語、中文等)。手寫文字無法可靠辨識,僅支援印刷文字。可搜尋PDF文字層支援帶全部變音符號的拉丁字母、希臘文和西里爾文;遇到CJK、阿拉伯文、希伯來文、天城文或泰文時,請使用包含完整辨識文字的「僅文字(TXT)」輸出。
113種 - 從中文、英語、德語,到阿拉伯語、印地語、泰語,再到日語和韓語。每種語言都以其本族名稱顯示在清單中,所有語言包都託管在gottrix自己這裡,不在第三方。
是的,完全免費 - 無需帳戶、無浮水印、沒有頁數或每日限制。頁數很多只是相應更耗時,因為辨識是由你自己的裝置計算的。
因為掃描檔永遠不會離開你的裝置:不上傳、不經伺服器處理、不會在別人的雲端留下副本。首次載入後辨識甚至可以離線執行 - 這是什麼都沒有被傳輸的最有力證明。
圖片辨識文字 (OCR) · PDF轉Word · 壓縮 PDF · PDF轉Markdown文件 · PDF 轉文字 · PDF轉EPUB