PDF OCR 検索可能化
スキャンしたPDFをOCRで検索可能に変換 - ブラウザ内で処理、元のページの下に不可視テキスト層を追加、アップロード不要。
お使いの端末でローカル処理中 ...
ファイル
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
私のファイルはアップロードされますか?
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
スキャンしたPDFをOCRで検索可能に変換 - ブラウザ内で処理、元のページの下に不可視テキスト層を追加、アップロード不要。
お使いの端末でローカル処理中 ...
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
スキャンしたPDFは本質的には画像の集まりです。テキストは見えても、選択・検索・コピーができません。OCR (光学文字認識) は画像から文字を読み取り、各ページの上に不可視のテキスト層として正確に重ねます。見た目は変わらないのに、PDFが検索可能になりテキストを選択できるようになります。これは官公庁・アーカイブ・全文検索システムが期待する標準的な形式です。
出力形式は検索可能PDF (元のページにテキスト層を追加) またはTXTとしての純粋なテキストから選べます。リストからドキュメントの言語を設定してください。ドイツ語・英語・ロシア語・アラビア語・ヒンディー語から日本語・韓国語・中国語まで113の言語があり、各言語は自身の名称で表示されます。すべてWebAssemblyでブラウザ内に動作します。「画像からテキスト」ツールと同じオープンソースのTesseractエンジンを、PDF全体にページごとに適用します。初回利用時にエンジンと選択した言語モデルを一度取得します (数MB、同一オリジン)。その後はオフラインでも動作します。
このツールはスキャンまたは画像ベースのPDFを対象としています。認識精度はスキャン品質に大きく依存します。鮮明・水平・高コントラストの印刷ページは非常に高精度で認識されますが、傾いたページやぼやけたページは精度が落ちます。手書きは確実には認識されません。検索可能PDFでは各ページが画像として再埋め込みされます。すでに本物のテキストを含むPDFにOCRは不要です。数字や固有名詞は結果を確認してください。
文字認識は普通ならクラウドの領分です。有名なOCRサービスはスキャンを処理のために自社サーバーへアップロードします - よりによって契約書・診断書・身分証のような書類をです。ここでは認識処理全体がWebAssembly化されたTesseractとしてブラウザー内で動き、113の言語パックはすべてgottrix自身がホストしています - 認識中に第三者から読み込まれるものは一切ありません。さらに言語リストは、表示言語に合わせてあらかじめ選択された状態で始まります。無料、アカウント不要、ページ数制限なしです。
| 入力形式 | |
|---|---|
| 自動変換 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 出力形式 | PDF, TXT |
| 一括処理 | 対応 |
| 処理 | ブラウザ内でローカル処理 (WebAssembly) |
| ファイルのアップロード | なし |
制限: スキャン・画像PDFをOCRで検索可能にする (不可視テキスト層) またはプレーンテキストとして出力します。113の言語・多様な文字体系の印刷テキストを認識します。手書きは確実には認識できません。注意: 検索可能PDFの不可視テキスト層は、すべての発音区別符号を含むラテン文字 (113言語のうち23言語、例えばポーランド語・チェコ語・ベトナム語・トルコ語など)、ギリシャ文字、キリル文字に対応しています。それ以外の文字体系 (CJK・アラビア文字・ヘブライ文字・デーバナーガリー・タイ文字など) は、文字化けした状態で埋め込むのではなく意図的に省略します。これらの文字体系には「テキストのみ (TXT)」出力をご利用ください。検索可能PDFでは各ページが画像として再埋め込みされるためレイアウトは保持されますが、ファイルサイズが大きくなる場合があります。すでにテキストを含むPDFにOCRは不要です。認識は完全ではないため、特に数字や固有名詞を確認してください。エンジンと言語モデルは初回のみ取得します (数MB、同一オリジン)。大きなPDFはページ数と端末によって時間とメモリが必要になる場合があります。
いいえ。レンダリングとテキスト認識はすべてブラウザ内でローカルに実行されます (WebAssembly)。PDFは端末から外に出ません。契約書や公文書を扱う際に特に重要な利点です。
見た目はスキャン画像と同じですが、その下に不可視のテキスト層が追加されています。これによりPDF内を検索したり、テキストを選択・コピーしたりできるようになります。視覚的な表示は変わりません。
はい。各ページは元ページの画像として再埋め込みされ、不可視のテキスト層がその上に正確に配置されます。見た目は変わりませんが、ファイルサイズが若干大きくなる場合があります。
他の言語は対応しています。アラビア語・ロシア語・ヒンディー語・日本語・韓国語・中国語など100以上の言語が選択可能です。手書きは確実には認識できません。印刷テキストのみ対応しています。検索可能PDFのテキスト層は、すべての発音区別符号を含むラテン文字・ギリシャ文字・キリル文字に対応しています。CJK・アラビア文字・ヘブライ文字・デーバナーガリー・タイ文字には、認識されたテキストがすべて含まれる「テキストのみ (TXT)」出力をご利用ください。
113言語です - 日本語、英語、ドイツ語からアラビア語、ヒンディー語、タイ語、そして韓国語や中国語まで。各言語はリストに自身の言語名で表示され、言語パックはすべて第三者ではなくgottrix自身がホストしています。
はい、完全に無料です - アカウント不要、透かしなし、ページ数制限も1日あたりの制限もありません。ページが多いぶん時間が比例して長くなるだけです。認識を計算するのは自分の端末だからです。
スキャンが端末から一切出ていかないからです。アップロードなし、サーバー処理なし、他社クラウドへのコピーなし。初回読み込み後はオフラインでも認識が動きます - 何も送信されていないことの何よりの証明です。
画像からテキスト (OCR) · PDFをWordに · PDFを圧縮 · PDFをMarkdownに変換 · PDFをテキストに · PDFをEPUBに