PDF 转文本
把 PDF 的文本层提取为一个纯 .txt 文件,便于复制、再利用或搜索。本地处理,无需上传。
正在你的设备上本地处理 ...
你的文件
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
我的文件会被上传吗?
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
把 PDF 的文本层提取为一个纯 .txt 文件,便于复制、再利用或搜索。本地处理,无需上传。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
顺序会按页面逐一重建:处于同一高度的文字片段会组成一行,按照从上到下、从左到右的顺序读取。页与页之间用一个空行分隔,方便你直接复用、导入或搜索输出结果。
| 输入格式 | |
|---|---|
| 自动转换 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 输出格式 | TXT |
| 批量处理 | 不支持 |
| 处理方式 | 在浏览器中本地处理 (JavaScript) |
| 文件上传 | 无 |
限制: 提取 PDF 中现有的文本层,并以 UTF-8 的 .txt 文件返回;行由文本位置重建。扫描的或纯图像的 PDF 没有文本层,此时输出为空:请改用 PDF OCR。字体、图片、颜色和精确版式(多栏页面、表格)会丢失,或只作线性近似。受密码保护的 PDF 请先用解锁 PDF 打开。
很可能你的 PDF 是扫描件或由图片组成,没有文本层。请改用从像素识别文本的 PDF OCR。
不会。你得到的是按阅读顺序排列的纯文本。字体、图片、分栏和表格不会被原样呈现。
UTF-8,因此中文和特殊字符都能正确保留。
页与页之间用一个空行分隔。
不会,文本提取完全在浏览器中本地完成。
PDF OCR 可搜索化 · PDF转Word · 提取 PDF 页面 · PDF 转 Markdown · DOCX 转 HTML · DOCX 转 Markdown