擷取PDF表格
偵測PDF中的表格,並匯出為CSV、Excel(XLSX)或JSON,有無框線皆可。全程在瀏覽器本機完成,無須上傳。
正在你的裝置上本機處理 ...
你的檔案
正在你的裝置上本機處理 ...
0%
你的檔案永遠不會離開你的裝置
我的檔案會被上傳嗎?
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
偵測PDF中的表格,並匯出為CSV、Excel(XLSX)或JSON,有無框線皆可。全程在瀏覽器本機完成,無須上傳。
正在你的裝置上本機處理 ...
正在你的裝置上本機處理 ...
0%
你的檔案永遠不會離開你的裝置
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
數字常常被困在最無法利用的地方:PDF裡的表格中。發票、報告、銀行對帳單、研究資料:想把這些數值放進Excel、資料庫或程式腳本的人,以前只能手動重新輸入,或與貼上後散掉的欄位纏鬥。本工具會自動辨識PDF中的表格,並保留結構匯出:CSV適合試算表與匯入,Excel活頁簿(XLSX)為每個表格建立獨立工作表,JSON則附有座標,方便在程式碼中進一步處理。
偵測採用與知名專業工具相同的兩種技術:有框線的表格透過頁面上實際繪製的線條辨識(網格模式),線條構成儲存格網格,每段文字被指派到所屬儲存格。無框線的表格透過對齊方式辨識(間距模式):在多行中位於相同欄位置的文字區塊構成各欄,貫穿始終的空白縫隙即為欄邊界。自動模式先尋找線條,找不到時改用間距分析;兩種模式也可手動指定。支援多個表格與多頁PDF:每個偵測到的表格都會單獨匯出。
誠實且重要:偵測讀取的是PDF的文字圖層。掃描版或純圖片PDF沒有這一層;此時工具會如實告知,而不是輸出空白或憑空捏造的表格。請先用「PDF OCR」把掃描檔轉換成可搜尋文字,再擷取表格。複雜版面也有限制:合併儲存格或巢狀表格僅能近似還原,無法逐像素重建。所有處理都透過pdf.js在瀏覽器本機完成,檔案絕不會離開你的裝置。
| 輸入格式 | |
|---|---|
| 自動轉換 | PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX |
| 輸出格式 | CSV, XLSX, JSON |
| 批次處理 | 不支援 |
| 處理方式 | 在瀏覽器中本機處理 (JavaScript) |
| 檔案上傳 | 無 |
限制: 透過框線(網格)或文字對齊(間距)偵測表格,並匯出為CSV(每個表格一個檔案,多個打包為ZIP)、XLSX(每個表格一個工作表)或JSON(含頁碼、儲存格及以PDF點為單位的座標)。需要真實的文字圖層:掃描版PDF請先用「PDF OCR」轉換。合併儲存格與複雜版面僅能近似還原;Excel匯出中只有無歧義的數字(小數點為英文句點)才會成為數字儲存格。受密碼保護的PDF請先用「解鎖PDF」開啟。
採用兩種技術:有框線的表格中,繪製的線條構成儲存格網格(網格模式);無框線的表格中,透過文字對齊與貫穿的空白縫隙辨識欄(間距模式)。自動模式會自行挑選合適的技術。
掃描檔只有影像像素,沒有可讀取的文字圖層。請先用「PDF OCR」把PDF轉換成可搜尋文字,再擷取表格。
可以。工具會掃描所有頁面,每個偵測到的表格都單獨匯出:作為獨立的CSV檔(多個打包成ZIP)、Excel檔中的獨立工作表,或JSON中的一個項目。
完整的結構:每個表格的頁碼、偵測模式與位置;每個儲存格的文字及其以PDF點為單位的邊界框(原點在左下角)。非常適合腳本與資料管線。
跨多欄的合併儲存格在網格中沒有唯一位置,其內容會落入其中一個儲存格,其餘保持空白。這是誠實的近似:即使專業桌面工具也無法完美解決。
不會。偵測與匯出全部透過pdf.js在瀏覽器本機完成,檔案絕不會離開你的裝置。
能,任何裝有新版瀏覽器的裝置都行 - Windows、Mac、Linux、Chromebook或手機。特別大的PDF在行動裝置上只是需要更多時間和記憶體。
PDF 轉文字 · PDF OCR 可搜尋轉換 · XLSX 轉 CSV · CSV 轉 XLSX · CSV 轉 JSON · PDF轉Markdown文件