提取PDF表格
识别PDF中的表格,并导出为CSV、Excel(XLSX)或JSON,有无边框均可。全程在浏览器本地完成,无需上传。
正在你的设备上本地处理 ...
你的文件
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
我的文件会被上传吗?
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
识别PDF中的表格,并导出为CSV、Excel(XLSX)或JSON,有无边框均可。全程在浏览器本地完成,无需上传。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
数字常常被困在最无法利用的地方:PDF里的表格中。发票、报告、银行流水、研究资料:想把这些数值放进Excel、数据库或脚本的人,以前只能手动重新输入,或者与粘贴后散架的列苦苦搏斗。本工具可自动识别PDF中的表格,并保留结构导出:CSV适合电子表格和导入,Excel工作簿(XLSX)为每个表格建立独立工作表,JSON则带有坐标,便于在代码中继续处理。
识别采用与知名专业工具相同的两种技术:带边框的表格通过页面上实际绘制的线条识别(网格模式),线条构成单元格网格,每段文字被分配到所属单元格。无边框的表格通过对齐方式识别(间距模式):在多行中处于相同列位置的文字块构成各列,贯穿始终的空白间隙即为列边界。自动模式先寻找线条,找不到时改用间距分析;两种模式也可手动指定。支持多个表格和多页PDF:每个识别出的表格都会单独导出。
诚实且重要:识别读取的是PDF的文本层。扫描版或纯图片PDF没有这一层;此时工具会如实告知,而不是输出空白或凭空捏造的表格。请先用“PDF OCR”把扫描件转换成可搜索文本,再提取表格。复杂版式也有局限:合并单元格或嵌套表格只能近似还原,无法逐像素重建。所有处理都通过pdf.js在浏览器本地完成,文件绝不会离开你的设备。
| 输入格式 | |
|---|---|
| 自动转换 | PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX |
| 输出格式 | CSV, XLSX, JSON |
| 批量处理 | 不支持 |
| 处理方式 | 在浏览器中本地处理 (JavaScript) |
| 文件上传 | 无 |
限制: 通过边框线(网格)或文字对齐(间距)识别表格,并导出为CSV(每个表格一个文件,多个打包为ZIP)、XLSX(每个表格一个工作表)或JSON(含页码、单元格及以PDF磅为单位的坐标)。需要真实的文本层:扫描版PDF请先用“PDF OCR”转换。合并单元格和复杂版式只能近似还原;Excel导出中只有无歧义的数字(小数点为英文句点)才会成为数字单元格。受密码保护的PDF请先用“解锁PDF”打开。
采用两种技术:带边框的表格中,绘制的线条构成单元格网格(网格模式);无边框的表格中,通过文字对齐和贯穿的空白间隙识别列(间距模式)。自动模式会自行选择合适的技术。
扫描件只有图像像素,没有可读取的文本层。请先用“PDF OCR”把PDF转换成可搜索文本,再提取表格。
可以。工具会扫描所有页面,每个识别出的表格都单独导出:作为独立的CSV文件(多个打包成ZIP)、Excel文件中的独立工作表,或JSON中的一个条目。
完整的结构:每个表格的页码、识别模式和位置;每个单元格的文字及其以PDF磅为单位的边界框(原点在左下角)。非常适合脚本和数据管道。
跨多列的合并单元格在网格中没有唯一位置,其内容会落入其中一个单元格,其余保持为空。这是诚实的近似:即使专业桌面工具也无法完美解决。
不会。识别和导出全部通过pdf.js在浏览器本地完成,文件绝不会离开你的设备。
能,任何装有新版浏览器的设备都行 - Windows、Mac、Linux、Chromebook或手机。特别大的PDF在移动设备上只是需要更多时间和内存。
PDF 转文本 · PDF OCR 可搜索化 · XLSX 转 CSV · CSV 转 XLSX · CSV 转 JSON · PDF 转 Markdown