zh

PDF OCR 可搜索化

用OCR让扫描PDF变为可搜索,在浏览器中本地处理,在原始页面下方添加不可见文字层,无需上传。

正在你的设备上本地处理 ...

输出格式
  • 可搜索PDF
  • 仅文本 (TXT)
文档语言
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

你的文件

    正在你的设备上本地处理 ...

    0%

    我的文件会被上传吗?

    不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证

    无需上传100% 本地处理
    内容只属于你第三方无法访问
    Hosted in GermanyGlobal Content Delivery
    经独立审计TLS A+ · 标头 A+

    扫描PDF本质上是一叠图片:你能看到文字,却无法选取、搜索或复制。OCR(光学字符识别)从图片中读取文字,并将其精确地以不可见文字层覆盖在每一页上。外观完全不变,但PDF变得可以搜索,文字可以选取。这正是政府机构、档案馆和全文搜索系统所期望的格式。

    输出格式可选:可搜索PDF(原始页面加文字层)或TXT纯文本。从列表中设置文档语言,支持113种语言,从德语、英语、俄语、阿拉伯语、印地语到日语、韩语和中文,每种语言均以自身名称显示,确保字符正确识别。所有处理均通过WebAssembly在浏览器中运行:与「图片转文字」工具相同的开源Tesseract引擎,逐页应用于整个PDF。首次使用时浏览器一次性下载引擎和所选语言模型(几MB,同源);此后离线可用。

    本工具适用于扫描件或图片型PDF。识别质量高度依赖扫描质量:清晰、端正、高对比度的印刷页面识别效果极佳,倾斜或模糊的页面效果较差;手写文字无法可靠识别。在可搜索PDF中,每页会以图片形式重新嵌入,因此已含真实文字的PDF无需OCR处理。请核查数字和专有名词的识别结果。

    文字识别通常是云端的领地:知名OCR服务会把每份扫描件上传到自己的服务器处理 - 偏偏是合同、医疗报告或证件这类文件。在这里,整个识别过程由编译成WebAssembly的Tesseract在你的浏览器里完成,全部113个语言包都托管在gottrix自己的服务器上 - 识别过程中不会从第三方加载任何内容。语言列表还会根据你的界面语言预先选好。免费、无需账户、页数不限。

    技术规格

    技术规格
    输入格式PDF
    自动转换PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    输出格式PDF, TXT
    批量处理支持
    处理方式在浏览器中本地处理 (WebAssembly)
    文件上传

    三步完成

    1. 拖入扫描PDF。
    2. 选择输出格式(可搜索PDF或文本)及文档语言。
    3. 下载可搜索PDF或TXT。

    限制: 适用于扫描/图片型PDF:通过OCR使其可搜索(不可见文字层)或输出纯文本。可识别113种语言及多种文字体系的印刷文字;手写文字无法可靠识别。注意:可搜索PDF中的不可见文字层支持带全部变音符号的拉丁字母(113种语言中的23种,如波兰文、捷克文、越南文、土耳其文)、希腊文和西里尔文。其他文字体系的字符(如CJK、阿拉伯文、希伯来文、天城文、泰文)会被有意略去,而不是以乱码形式嵌入;对于这些文字体系,请使用「仅文本(TXT)」输出。可搜索PDF中每页以图片形式重新嵌入,布局保留但文件可能变大;已含真实文字的PDF无需OCR。识别并非完全准确,请特别核查数字和专有名词。引擎和语言模型一次性下载(几MB,同源),之后离线可用。大型PDF因页数和设备不同,处理时间和内存占用会有所不同。

    常见问题

    我的PDF会被上传吗?

    不会。渲染和文字识别完全在浏览器本地运行(WebAssembly),PDF不会离开你的设备。处理合同和官方文件时尤为重要。

    什么是可搜索PDF?

    页面看起来与扫描原件相同,但其下方有一个不可见的文字层。这样你就可以在PDF中搜索、选取和复制文字,而视觉效果保持不变。

    排版布局会保留吗?

    会。每页以原始页面的图片形式重新嵌入,不可见文字层精确叠加其上。外观不变,但文件大小可能略有增加。

    能识别手写或其他语言吗?

    其他语言可以:支持100多种语言(包括阿拉伯语、俄语、印地语、日语、韩语、中文等)。手写文字无法可靠识别,仅支持印刷文字。可搜索PDF文字层支持带全部变音符号的拉丁字母、希腊文和西里尔文;遇到CJK、阿拉伯文、希伯来文、天城文或泰文时,请使用包含完整识别文本的「仅文本(TXT)」输出。

    文字识别支持多少种语言?

    113种 - 从中文、英语、德语,到阿拉伯语、印地语、泰语,再到日语和韩语。每种语言都以其本族名称显示在列表中,所有语言包都托管在gottrix自己这里,不在第三方。

    PDF OCR免费吗?有页数限制吗?

    是的,完全免费 - 无需账户、无水印、没有页数或每日限制。页数很多只是相应更耗时,因为识别是由你自己的设备计算的。

    为什么本地文字识别更适合机密扫描件?

    因为扫描件永远不会离开你的设备:不上传、不经服务器处理、不会在别人的云端留下副本。首次加载后识别甚至可以离线运行 - 这是什么都没有被传输的最有力证明。

    相关工具

    图片转文字 (OCR) · PDF转Word · 压缩 PDF · PDF 转 Markdown · PDF 转文本 · PDF转EPUB