th

PDF OCR (ค้นหาได้)

ทำให้ PDF ที่สแกนค้นหาได้ผ่าน OCR - ในเบราว์เซอร์ มีชั้นข้อความซ่อนอยู่ใต้หน้าต้นฉบับ ไม่อัปโหลด

กำลังประมวลผลในเครื่องของคุณ ...

ผลลัพธ์
  • PDF ที่ค้นหาได้
  • เฉพาะข้อความ (TXT)
ภาษาของเอกสาร
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

ไฟล์ของคุณ

    กำลังประมวลผลในเครื่องของคุณ ...

    0%

    ไฟล์ของคุณไม่เคยออกจากอุปกรณ์

      ทำต่อกับไฟล์นี้

      ไม่ต้องอัปโหลดซ้ำ

      เครื่องมือเหล่านี้รองรับ .PDF - ไฟล์ของคุณจะถูกส่งต่อโดยตรง

      ไฟล์ของฉันถูกอัปโหลดไหม

      ไม่ ทุกอย่างทำงานในเบราว์เซอร์ของคุณ - ไฟล์ของคุณไม่เคยออกจากอุปกรณ์ ตรวจสอบเรื่องนี้ได้อย่างไร

      ไม่ต้องอัปโหลดทำงานในเครื่อง 100%
      เนื้อหายังอยู่กับคุณไม่มีบุคคลที่สามเข้าถึง
      Hosted in GermanyGlobal Content Delivery
      ตรวจสอบโดยอิสระTLS A+ · ส่วนหัว HTTP A+

      PDF ที่สแกนโดยพื้นฐานแล้วคือกองรูปภาพ: คุณเห็นข้อความแต่ไม่สามารถเลือก ค้นหา หรือคัดลอกได้ OCR (การรู้จำอักขระด้วยแสง) อ่านตัวอักษรจากรูปภาพและวางเป็นชั้นข้อความซ่อนอยู่ตรงกับหน้า รูปลักษณ์ยังคงเหมือนเดิม แต่ PDF กลายเป็นสิ่งที่ค้นหาได้และข้อความสามารถเลือกได้ - ตรงกับสิ่งที่หน่วยงาน คลังข้อมูล และการค้นหาข้อความแบบเต็มต้องการ

      เลือกผลลัพธ์: PDF ที่ค้นหาได้ (หน้าต้นฉบับพร้อมชั้นข้อความ) หรือข้อความธรรมดาเป็น TXT ตั้งภาษาของเอกสารจากรายการ - 113 ภาษาจากภาษาไทยและอังกฤษ ผ่านรัสเซีย อาหรับ และฮินดี ไปจนถึงญี่ปุ่น เกาหลี และจีน แต่ละภาษาในชื่อของตัวเอง - เพื่อให้อักขระถูกรู้จำอย่างถูกต้อง ทุกอย่างทำงานในเบราว์เซอร์ผ่าน WebAssembly: เอนจิน Tesseract แบบโอเพนซอร์สเดียวกับเครื่องมือ "รูปภาพเป็นข้อความ" ใช้กับแต่ละหน้าในทั้ง PDF เมื่อใช้ครั้งแรก เบราว์เซอร์ดาวน์โหลดเอนจินและโมเดลภาษาที่เลือกครั้งเดียว (ไม่กี่ MB same-origin) จากนั้นทำงานออฟไลน์ได้

      เครื่องมือนี้มีไว้สำหรับ PDF ที่สแกนหรือแบบรูปภาพ การรู้จำขึ้นอยู่กับคุณภาพการสแกนมาก: หน้าที่คมชัด ตรง คอนทราสต์สูงพร้อมข้อความพิมพ์รู้จำได้ดีมาก ส่วนเอียงหรือเบลอแย่กว่ามาก ลายมือไม่น่าเชื่อถือ ใน PDF ที่ค้นหาได้ แต่ละหน้าจะถูกฝังใหม่เป็นรูปภาพ - PDF ที่มีข้อความจริงอยู่แล้วไม่จำเป็นต้องใช้ OCR ตรวจสอบผลลัพธ์สำหรับตัวเลขและชื่อเฉพาะ

      การรู้จำข้อความมักเป็นอาณาเขตของคลาวด์: บริการ OCR ชื่อดังอัปโหลดสแกนทุกฉบับไปประมวลผลบนเซิร์ฟเวอร์ของตน - ทั้งที่เป็นเอกสารอย่างสัญญา เอกสารทางการแพทย์ หรือบัตรประจำตัว ที่นี่การรู้จำทั้งหมดทำงานด้วย Tesseract ในรูปแบบ WebAssembly ในเบราว์เซอร์ของคุณ และแพ็กเกจภาษา 113 ชุดทั้งหมดโฮสต์อยู่บน gottrix เอง - ระหว่างการรู้จำไม่มีการโหลดอะไรจากบุคคลที่สาม อีกทั้งรายการภาษายังเริ่มต้นด้วยการเลือกไว้ล่วงหน้าตามภาษาอินเทอร์เฟซของคุณ ฟรี ไม่ต้องมีบัญชี และไม่จำกัดหน้า

      ข้อมูลทางเทคนิค

      ข้อมูลทางเทคนิค
      รูปแบบที่รองรับPDF
      การแปลงอัตโนมัติPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      รูปแบบผลลัพธ์PDF, TXT
      การประมวลผลเป็นชุดรองรับ
      การประมวลผลภายในเบราว์เซอร์ (WebAssembly)
      การอัปโหลดไฟล์ไม่มี

      ใน 3 ขั้นตอน

      1. วาง PDF ที่สแกน
      2. เลือกผลลัพธ์ (PDF ที่ค้นหาได้หรือข้อความ) และภาษาจากรายการ
      3. ดาวน์โหลด PDF ที่ค้นหาได้หรือ TXT

      ข้อจำกัด: สำหรับ PDF แบบสแกน/รูปภาพ: ทำให้ค้นหาได้ผ่าน OCR (ชั้นข้อความซ่อน) หรือส่งคืนข้อความธรรมดา รู้จำข้อความ พิมพ์ ใน113 ภาษาและอักษรหลายประเภท ลายมือไม่น่าเชื่อถือ หมายเหตุ: ชั้นข้อความซ่อนใน PDF ที่ค้นหาได้ครอบคลุมอักษรละตินพร้อมเครื่องหมายกำกับเสียงทั้งหมด (23 จาก 113 ภาษา เช่น โปแลนด์ เช็ก เวียดนาม ตุรกี) กรีก และซีริลลิก อักขระของระบบเขียนอื่น (เช่น CJK อาหรับ ฮีบรู เทวนาครี ไทย) จะถูกละไว้อย่างตั้งใจแทนที่จะฝังแบบผิดเพี้ยน สำหรับอักษรเหล่านั้น ผลลัพธ์ "เฉพาะข้อความ (TXT)" ส่งคืนข้อความที่รู้จำทั้งหมด ใน PDF ที่ค้นหาได้ แต่ละหน้าจะถูกฝังใหม่เป็นรูปภาพ ดังนั้นเลย์เอาต์ยังคงอยู่แต่ไฟล์อาจโตขึ้น PDF ที่มีข้อความจริงอยู่แล้วไม่จำเป็นต้องใช้ OCR การรู้จำไม่สมบูรณ์แบบ - ตรวจสอบตัวเลขและชื่อเฉพาะโดยเฉพาะ เอนจินและโมเดลภาษาที่เลือกดาวน์โหลดครั้งเดียว (ไม่กี่ MB same-origin) จากนั้นใช้งานออฟไลน์ได้ PDF ขนาดใหญ่ต้องใช้เวลาและหน่วยความจำขึ้นอยู่กับจำนวนหน้าและอุปกรณ์

      คำถามที่พบบ่อย

      PDF ของฉันถูกอัปโหลดหรือไม่?

      ไม่ การเรนเดอร์และการรู้จำทำงานทั้งหมดในเบราว์เซอร์ในเครื่อง (WebAssembly) PDF ไม่เคยออกจากอุปกรณ์ของคุณ - ข้อได้เปรียบสำคัญสำหรับสัญญาและเอกสารราชการ

      PDF ที่ค้นหาได้คืออะไร?

      หน้าดูเหมือนสแกน แต่ด้านล่างมีชั้นข้อความซ่อนอยู่ ซึ่งช่วยให้ค้นหาใน PDF เลือกและคัดลอกข้อความได้ - ในขณะที่รูปลักษณ์ภาพยังคงเหมือนเดิม

      เลย์เอาต์ยังคงอยู่หรือไม่?

      ใช่ แต่ละหน้าถูกฝังเป็นรูปภาพของหน้าต้นฉบับ พร้อมชั้นข้อความซ่อนวางอยู่ตรงบนนั้น รูปลักษณ์ไม่เปลี่ยนแปลง แม้ว่าไฟล์อาจโตขึ้นเล็กน้อย

      รู้จำลายมือหรือภาษาอื่นได้หรือไม่?

      ภาษาอื่นได้: มากกว่า 100 ภาษา (รวมถึงอาหรับ รัสเซีย ฮินดี ญี่ปุ่น เกาหลี จีน) ลายมือไม่ถูกรู้จำอย่างน่าเชื่อถือ มีเพียงข้อความพิมพ์ ชั้นข้อความของ PDF ที่ค้นหาได้ครอบคลุมอักษรละตินพร้อมเครื่องหมายกำกับเสียงทั้งหมด กรีก และซีริลลิก สำหรับ CJK อาหรับ ฮีบรู เทวนาครี หรือไทย ใช้ผลลัพธ์ "เฉพาะข้อความ (TXT)" ซึ่งมีข้อความที่รู้จำทั้งหมด

      การรู้จำข้อความรองรับกี่ภาษา

      113 ภาษา - จากภาษาไทย อังกฤษ และเยอรมัน ผ่านอาหรับ ฮินดี ไปจนถึงญี่ปุ่น เกาหลี และจีน แต่ละภาษาแสดงในรายการด้วยชื่อของภาษานั้นเอง และแพ็กเกจภาษาทั้งหมดโฮสต์อยู่บน gottrix เอง ไม่ใช่บุคคลที่สาม

      OCR ของ PDF ฟรีไหม มีจำกัดหน้าหรือเปล่า

      ฟรีทั้งหมด - ไม่ต้องมีบัญชี ไม่มีลายน้ำ และไม่มีขีดจำกัดหน้าหรือรายวัน หน้าจำนวนมากแค่ใช้เวลานานขึ้นตามส่วน เพราะอุปกรณ์ของคุณเองเป็นผู้คำนวณการรู้จำ

      ทำไมการรู้จำในเครื่องจึงดีกว่าสำหรับสแกนที่เป็นความลับ

      เพราะสแกนไม่เคยออกจากอุปกรณ์ของคุณ: ไม่มีการอัปโหลด ไม่มีการประมวลผลบนเซิร์ฟเวอร์ ไม่มีสำเนาในคลาวด์ของคนอื่น หลังโหลดครั้งแรก การรู้จำยังทำงานแบบออฟไลน์ได้ด้วย - หลักฐานที่หนักแน่นที่สุดว่าไม่มีอะไรถูกส่งออกไป

      เครื่องมือที่เกี่ยวข้อง

      รูปภาพเป็นข้อความ (OCR) · PDF เป็น Word · บีบอัด PDF · PDF เป็น Markdown · PDF เป็นข้อความ · PDF เป็น EPUB