PDF OCR 可搜索化
用OCR让扫描PDF变为可搜索,在浏览器中本地处理,在原始页面下方添加不可见文字层,无需上传。
正在你的设备上本地处理 ...
你的文件
正在你的设备上本地处理 ...
0%
我的文件会被上传吗?
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
用OCR让扫描PDF变为可搜索,在浏览器中本地处理,在原始页面下方添加不可见文字层,无需上传。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
扫描PDF本质上是一叠图片:你能看到文字,却无法选取、搜索或复制。OCR(光学字符识别)从图片中读取文字,并将其精确地以不可见文字层覆盖在每一页上。外观完全不变,但PDF变得可以搜索,文字可以选取。这正是政府机构、档案馆和全文搜索系统所期望的格式。
输出格式可选:可搜索PDF(原始页面加文字层)或TXT纯文本。从列表中设置文档语言,支持113种语言,从德语、英语、俄语、阿拉伯语、印地语到日语、韩语和中文,每种语言均以自身名称显示,确保字符正确识别。所有处理均通过WebAssembly在浏览器中运行:与「图片转文字」工具相同的开源Tesseract引擎,逐页应用于整个PDF。首次使用时浏览器一次性下载引擎和所选语言模型(几MB,同源);此后离线可用。
本工具适用于扫描件或图片型PDF。识别质量高度依赖扫描质量:清晰、端正、高对比度的印刷页面识别效果极佳,倾斜或模糊的页面效果较差;手写文字无法可靠识别。在可搜索PDF中,每页会以图片形式重新嵌入,因此已含真实文字的PDF无需OCR处理。请核查数字和专有名词的识别结果。
文字识别通常是云端的领地:知名OCR服务会把每份扫描件上传到自己的服务器处理 - 偏偏是合同、医疗报告或证件这类文件。在这里,整个识别过程由编译成WebAssembly的Tesseract在你的浏览器里完成,全部113个语言包都托管在gottrix自己的服务器上 - 识别过程中不会从第三方加载任何内容。语言列表还会根据你的界面语言预先选好。免费、无需账户、页数不限。
| 输入格式 | |
|---|---|
| 自动转换 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 输出格式 | PDF, TXT |
| 批量处理 | 支持 |
| 处理方式 | 在浏览器中本地处理 (WebAssembly) |
| 文件上传 | 无 |
限制: 适用于扫描/图片型PDF:通过OCR使其可搜索(不可见文字层)或输出纯文本。可识别113种语言及多种文字体系的印刷文字;手写文字无法可靠识别。注意:可搜索PDF中的不可见文字层支持带全部变音符号的拉丁字母(113种语言中的23种,如波兰文、捷克文、越南文、土耳其文)、希腊文和西里尔文。其他文字体系的字符(如CJK、阿拉伯文、希伯来文、天城文、泰文)会被有意略去,而不是以乱码形式嵌入;对于这些文字体系,请使用「仅文本(TXT)」输出。可搜索PDF中每页以图片形式重新嵌入,布局保留但文件可能变大;已含真实文字的PDF无需OCR。识别并非完全准确,请特别核查数字和专有名词。引擎和语言模型一次性下载(几MB,同源),之后离线可用。大型PDF因页数和设备不同,处理时间和内存占用会有所不同。
不会。渲染和文字识别完全在浏览器本地运行(WebAssembly),PDF不会离开你的设备。处理合同和官方文件时尤为重要。
页面看起来与扫描原件相同,但其下方有一个不可见的文字层。这样你就可以在PDF中搜索、选取和复制文字,而视觉效果保持不变。
会。每页以原始页面的图片形式重新嵌入,不可见文字层精确叠加其上。外观不变,但文件大小可能略有增加。
其他语言可以:支持100多种语言(包括阿拉伯语、俄语、印地语、日语、韩语、中文等)。手写文字无法可靠识别,仅支持印刷文字。可搜索PDF文字层支持带全部变音符号的拉丁字母、希腊文和西里尔文;遇到CJK、阿拉伯文、希伯来文、天城文或泰文时,请使用包含完整识别文本的「仅文本(TXT)」输出。
113种 - 从中文、英语、德语,到阿拉伯语、印地语、泰语,再到日语和韩语。每种语言都以其本族名称显示在列表中,所有语言包都托管在gottrix自己这里,不在第三方。
是的,完全免费 - 无需账户、无水印、没有页数或每日限制。页数很多只是相应更耗时,因为识别是由你自己的设备计算的。
因为扫描件永远不会离开你的设备:不上传、不经服务器处理、不会在别人的云端留下副本。首次加载后识别甚至可以离线运行 - 这是什么都没有被传输的最有力证明。
图片转文字 (OCR) · PDF转Word · 压缩 PDF · PDF 转 Markdown · PDF 转文本 · PDF转EPUB