PDF表を抽出
PDF内の表を検出して、CSV・Excel(XLSX)・JSONとして書き出せます。罫線の有無を問わず対応。ブラウザ内で完結し、アップロードはありません。
お使いの端末でローカル処理中 ...
ファイル
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
私のファイルはアップロードされますか?
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
PDF内の表を検出して、CSV・Excel(XLSX)・JSONとして書き出せます。罫線の有無を問わず対応。ブラウザ内で完結し、アップロードはありません。
お使いの端末でローカル処理中 ...
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
数値は、いちばん使いたい場面で使えない場所に閉じ込められがちです。それがPDF内の表です。請求書、レポート、銀行取引明細、調査資料など、その値をExcelやデータベース、スクリプトで使いたいとき、これまでは手で打ち直すか、コピー&ペーストで崩れる列と格闘するしかありませんでした。このツールはPDF内の表を自動で認識し、構造を保ったまま書き出します。表計算やインポート向けのCSV、表ごとにシートを分けたExcelブック(XLSX)、コードで処理するための座標つきJSONから選べます。
検出には、この分野の著名な専用ツールと同じ2つの手法を使います。罫線のある表は、ページに実際に描かれた線から認識します(グリッドモード)。線がセルの格子を形づくり、各テキストは自分のセルに割り当てられます。罫線のない表は位置揃えから認識します(間隔モード)。複数の行で同じ列位置に並ぶテキストブロックが列となり、どの行でも空いたままの隙間が列の境界になります。自動モードはまず罫線を探し、なければ間隔の分析に切り替えます。どちらのモードも手動で固定できます。複数の表や複数ページのPDFにも対応し、検出された表はそれぞれ個別に書き出されます。
正直で大切な点:検出はPDFのテキストレイヤーを読み取ります。スキャンされたPDFや画像だけのPDFにはこのレイヤーがありません。その場合、空の表やでたらめな表を出力する代わりに、その旨をはっきり表示します。スキャンはまず「PDF OCR」で検索可能なテキストに変換し、そのあとで表を抽出してください。複雑なレイアウトには限界もあります。結合セルや入れ子の表は近似となり、ピクセル単位では再現されません。処理はすべてブラウザ内のpdf.jsでローカルに実行され、ファイルが端末の外に出ることはありません。
| 入力形式 | |
|---|---|
| 自動変換 | PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX |
| 出力形式 | CSV, XLSX, JSON |
| 一括処理 | 非対応 |
| 処理 | ブラウザ内でローカル処理 (JavaScript) |
| ファイルのアップロード | なし |
制限: 罫線(グリッド)または文字の位置揃え(間隔)から表を検出し、CSV(表ごとに1ファイル、複数はZIP)、XLSX(表ごとに1シート)、JSON(ページ・セル・PDFポイント単位の座標つき)で書き出します。実際のテキストレイヤーが必要です。スキャンしたPDFは先に「PDF OCR」で変換してください。結合セルや複雑なレイアウトは近似になります。Excel出力では小数点がピリオドの明確な数値だけが数値セルになります。パスワード保護されたPDFは先に「PDFのロック解除」で開いてください。
2つの手法を使います。罫線のある表では、描かれた線がセルの格子になります(グリッドモード)。罫線のない表では、文字の位置揃えと連続した空白から列を認識します(間隔モード)。自動モードは適切な手法を自分で選びます。
スキャンは画像のピクセルだけで、読み取れるテキストレイヤーがありません。まず「PDF OCR」でPDFを検索可能なテキストに変換し、そのあとで表を抽出してください。
はい。全ページが走査され、検出された表はそれぞれ個別に書き出されます。表ごとのCSVファイル(複数はZIPにまとめて)、Excelファイル内の個別シート、またはJSON内の項目としてです。
構造の全体です。表ごとにページ番号・検出モード・位置、セルごとにテキストとPDFポイント単位の境界ボックス(原点は左下)が含まれます。スクリプトやデータパイプラインに最適です。
複数列にまたがる結合セルは、格子の中で一意の位置を持ちません。内容は関係するセルのひとつに入り、残りは空になります。これは正直な近似です。専用のデスクトップツールでも完全には解決できません。
いいえ。検出と書き出しはすべてブラウザ内のpdf.jsでローカルに実行され、ファイルが端末の外に出ることはありません。
はい、最新ブラウザーのある端末ならどれでも - Windows、Mac、Linux、Chromebook、スマートフォンで動きます。非常に大きなPDFはモバイル端末では時間とメモリーが多めに必要になるだけです。
PDFをテキストに · PDF OCR 検索可能化 · XLSX から CSV へ変換 · CSV から XLSX へ変換 · CSV から JSON へ変換 · PDFをMarkdownに変換