ja

PDF OCR 検索可能化

スキャンしたPDFをOCRで検索可能に変換 - ブラウザ内で処理、元のページの下に不可視テキスト層を追加、アップロード不要。

お使いの端末でローカル処理中 ...

出力形式
  • 検索可能PDF
  • テキストのみ (TXT)
ドキュメントの言語
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

ファイル

    お使いの端末でローカル処理中 ...

    0%

    私のファイルはアップロードされますか?

    いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由

    アップロード不要100%ローカル処理
    中身は手元のまま第三者のアクセスなし
    Hosted in GermanyGlobal Content Delivery
    第三者による検証済みTLS A+ · ヘッダー A+

    スキャンしたPDFは本質的には画像の集まりです。テキストは見えても、選択・検索・コピーができません。OCR (光学文字認識) は画像から文字を読み取り、各ページの上に不可視のテキスト層として正確に重ねます。見た目は変わらないのに、PDFが検索可能になりテキストを選択できるようになります。これは官公庁・アーカイブ・全文検索システムが期待する標準的な形式です。

    出力形式は検索可能PDF (元のページにテキスト層を追加) またはTXTとしての純粋なテキストから選べます。リストからドキュメントの言語を設定してください。ドイツ語・英語・ロシア語・アラビア語・ヒンディー語から日本語・韓国語・中国語まで113の言語があり、各言語は自身の名称で表示されます。すべてWebAssemblyでブラウザ内に動作します。「画像からテキスト」ツールと同じオープンソースのTesseractエンジンを、PDF全体にページごとに適用します。初回利用時にエンジンと選択した言語モデルを一度取得します (数MB、同一オリジン)。その後はオフラインでも動作します。

    このツールはスキャンまたは画像ベースのPDFを対象としています。認識精度はスキャン品質に大きく依存します。鮮明・水平・高コントラストの印刷ページは非常に高精度で認識されますが、傾いたページやぼやけたページは精度が落ちます。手書きは確実には認識されません。検索可能PDFでは各ページが画像として再埋め込みされます。すでに本物のテキストを含むPDFにOCRは不要です。数字や固有名詞は結果を確認してください。

    文字認識は普通ならクラウドの領分です。有名なOCRサービスはスキャンを処理のために自社サーバーへアップロードします - よりによって契約書・診断書・身分証のような書類をです。ここでは認識処理全体がWebAssembly化されたTesseractとしてブラウザー内で動き、113の言語パックはすべてgottrix自身がホストしています - 認識中に第三者から読み込まれるものは一切ありません。さらに言語リストは、表示言語に合わせてあらかじめ選択された状態で始まります。無料、アカウント不要、ページ数制限なしです。

    技術仕様

    技術仕様
    入力形式PDF
    自動変換PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    出力形式PDF, TXT
    一括処理対応
    処理ブラウザ内でローカル処理 (WebAssembly)
    ファイルのアップロードなし

    3ステップで

    1. スキャンしたPDFをドロップします。
    2. 出力形式 (検索可能PDFまたはテキスト) と言語をリストから選びます。
    3. 検索可能なPDFまたはTXTをダウンロードします。

    制限: スキャン・画像PDFをOCRで検索可能にする (不可視テキスト層) またはプレーンテキストとして出力します。113の言語・多様な文字体系の印刷テキストを認識します。手書きは確実には認識できません。注意: 検索可能PDFの不可視テキスト層は、すべての発音区別符号を含むラテン文字 (113言語のうち23言語、例えばポーランド語・チェコ語・ベトナム語・トルコ語など)、ギリシャ文字、キリル文字に対応しています。それ以外の文字体系 (CJK・アラビア文字・ヘブライ文字・デーバナーガリー・タイ文字など) は、文字化けした状態で埋め込むのではなく意図的に省略します。これらの文字体系には「テキストのみ (TXT)」出力をご利用ください。検索可能PDFでは各ページが画像として再埋め込みされるためレイアウトは保持されますが、ファイルサイズが大きくなる場合があります。すでにテキストを含むPDFにOCRは不要です。認識は完全ではないため、特に数字や固有名詞を確認してください。エンジンと言語モデルは初回のみ取得します (数MB、同一オリジン)。大きなPDFはページ数と端末によって時間とメモリが必要になる場合があります。

    よくある質問

    PDFはアップロードされますか?

    いいえ。レンダリングとテキスト認識はすべてブラウザ内でローカルに実行されます (WebAssembly)。PDFは端末から外に出ません。契約書や公文書を扱う際に特に重要な利点です。

    検索可能なPDFとは何ですか?

    見た目はスキャン画像と同じですが、その下に不可視のテキスト層が追加されています。これによりPDF内を検索したり、テキストを選択・コピーしたりできるようになります。視覚的な表示は変わりません。

    レイアウトは保持されますか?

    はい。各ページは元ページの画像として再埋め込みされ、不可視のテキスト層がその上に正確に配置されます。見た目は変わりませんが、ファイルサイズが若干大きくなる場合があります。

    手書きや他の言語も認識できますか?

    他の言語は対応しています。アラビア語・ロシア語・ヒンディー語・日本語・韓国語・中国語など100以上の言語が選択可能です。手書きは確実には認識できません。印刷テキストのみ対応しています。検索可能PDFのテキスト層は、すべての発音区別符号を含むラテン文字・ギリシャ文字・キリル文字に対応しています。CJK・アラビア文字・ヘブライ文字・デーバナーガリー・タイ文字には、認識されたテキストがすべて含まれる「テキストのみ (TXT)」出力をご利用ください。

    文字認識は何言語に対応していますか?

    113言語です - 日本語、英語、ドイツ語からアラビア語、ヒンディー語、タイ語、そして韓国語や中国語まで。各言語はリストに自身の言語名で表示され、言語パックはすべて第三者ではなくgottrix自身がホストしています。

    PDFのOCRは無料ですか? ページ数制限はありますか?

    はい、完全に無料です - アカウント不要、透かしなし、ページ数制限も1日あたりの制限もありません。ページが多いぶん時間が比例して長くなるだけです。認識を計算するのは自分の端末だからです。

    機密性の高いスキャンには、なぜローカルの文字認識が向いているのですか?

    スキャンが端末から一切出ていかないからです。アップロードなし、サーバー処理なし、他社クラウドへのコピーなし。初回読み込み後はオフラインでも認識が動きます - 何も送信されていないことの何よりの証明です。

    関連ツール

    画像からテキスト (OCR) · PDFをWordに · PDFを圧縮 · PDFをMarkdownに変換 · PDFをテキストに · PDFをEPUBに