ja

PDF表を抽出

PDF内の表を検出して、CSV・Excel(XLSX)・JSONとして書き出せます。罫線の有無を問わず対応。ブラウザ内で完結し、アップロードはありません。

お使いの端末でローカル処理中 ...

出力形式 出力ファイルの目的の形式です。
  • CSV
  • Excel (XLSX)
  • JSON
表の検出
  • 自動
  • 罫線あり(グリッド)
  • 罫線なし(間隔)
区切り文字
  • カンマ
  • セミコロン
  • タブ

ファイル

    お使いの端末でローカル処理中 ...

    0%

    私のファイルはアップロードされますか?

    いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由

    アップロード不要100%ローカル処理
    中身は手元のまま第三者のアクセスなし
    Hosted in GermanyGlobal Content Delivery
    第三者による検証済みTLS A+ · ヘッダー A+

    数値は、いちばん使いたい場面で使えない場所に閉じ込められがちです。それがPDF内の表です。請求書、レポート、銀行取引明細、調査資料など、その値をExcelやデータベース、スクリプトで使いたいとき、これまでは手で打ち直すか、コピー&ペーストで崩れる列と格闘するしかありませんでした。このツールはPDF内の表を自動で認識し、構造を保ったまま書き出します。表計算やインポート向けのCSV、表ごとにシートを分けたExcelブック(XLSX)、コードで処理するための座標つきJSONから選べます。

    検出には、この分野の著名な専用ツールと同じ2つの手法を使います。罫線のある表は、ページに実際に描かれた線から認識します(グリッドモード)。線がセルの格子を形づくり、各テキストは自分のセルに割り当てられます。罫線のない表は位置揃えから認識します(間隔モード)。複数の行で同じ列位置に並ぶテキストブロックが列となり、どの行でも空いたままの隙間が列の境界になります。自動モードはまず罫線を探し、なければ間隔の分析に切り替えます。どちらのモードも手動で固定できます。複数の表や複数ページのPDFにも対応し、検出された表はそれぞれ個別に書き出されます。

    正直で大切な点:検出はPDFのテキストレイヤーを読み取ります。スキャンされたPDFや画像だけのPDFにはこのレイヤーがありません。その場合、空の表やでたらめな表を出力する代わりに、その旨をはっきり表示します。スキャンはまず「PDF OCR」で検索可能なテキストに変換し、そのあとで表を抽出してください。複雑なレイアウトには限界もあります。結合セルや入れ子の表は近似となり、ピクセル単位では再現されません。処理はすべてブラウザ内のpdf.jsでローカルに実行され、ファイルが端末の外に出ることはありません。

    技術仕様

    技術仕様
    入力形式PDF
    自動変換PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    出力形式CSV, XLSX, JSON
    一括処理非対応
    処理ブラウザ内でローカル処理 (JavaScript)
    ファイルのアップロードなし

    3ステップで

    1. PDFをドロップします。
    2. 出力形式と検出方法を選びます。
    3. 表をCSV・XLSX・JSONでダウンロードします。

    制限: 罫線(グリッド)または文字の位置揃え(間隔)から表を検出し、CSV(表ごとに1ファイル、複数はZIP)、XLSX(表ごとに1シート)、JSON(ページ・セル・PDFポイント単位の座標つき)で書き出します。実際のテキストレイヤーが必要です。スキャンしたPDFは先に「PDF OCR」で変換してください。結合セルや複雑なレイアウトは近似になります。Excel出力では小数点がピリオドの明確な数値だけが数値セルになります。パスワード保護されたPDFは先に「PDFのロック解除」で開いてください。

    よくある質問

    表はどうやって検出されますか?

    2つの手法を使います。罫線のある表では、描かれた線がセルの格子になります(グリッドモード)。罫線のない表では、文字の位置揃えと連続した空白から列を認識します(間隔モード)。自動モードは適切な手法を自分で選びます。

    スキャンした書類で表が見つからないのはなぜですか?

    スキャンは画像のピクセルだけで、読み取れるテキストレイヤーがありません。まず「PDF OCR」でPDFを検索可能なテキストに変換し、そのあとで表を抽出してください。

    複数の表やページを一度に書き出せますか?

    はい。全ページが走査され、検出された表はそれぞれ個別に書き出されます。表ごとのCSVファイル(複数はZIPにまとめて)、Excelファイル内の個別シート、またはJSON内の項目としてです。

    JSON出力には何が含まれますか?

    構造の全体です。表ごとにページ番号・検出モード・位置、セルごとにテキストとPDFポイント単位の境界ボックス(原点は左下)が含まれます。スクリプトやデータパイプラインに最適です。

    結合セルが正確に出ないのはなぜですか?

    複数列にまたがる結合セルは、格子の中で一意の位置を持ちません。内容は関係するセルのひとつに入り、残りは空になります。これは正直な近似です。専用のデスクトップツールでも完全には解決できません。

    PDFはアップロードされますか?

    いいえ。検出と書き出しはすべてブラウザ内のpdf.jsでローカルに実行され、ファイルが端末の外に出ることはありません。

    表の抽出はスマートフォンやChromebookでも使えますか?

    はい、最新ブラウザーのある端末ならどれでも - Windows、Mac、Linux、Chromebook、スマートフォンで動きます。非常に大きなPDFはモバイル端末では時間とメモリーが多めに必要になるだけです。

    関連ツール

    PDFをテキストに · PDF OCR 検索可能化 · XLSX から CSV へ変換 · CSV から XLSX へ変換 · CSV から JSON へ変換 · PDFをMarkdownに変換