ms

PDF kepada teks

Ekstrak lapisan teks sesebuah PDF sebagai fail .txt ringkas, untuk disalin, diguna semula, atau dicari. Setempat, tanpa muat naik.

Memproses secara setempat pada peranti anda ...

Fail anda

    Memproses secara setempat pada peranti anda ...

    0%

    Adakah fail saya dimuat naik?

    Tidak. Semuanya berjalan dalam pelayar anda - fail anda tidak pernah meninggalkan peranti. Bagaimana ini boleh disahkan

    Tiada muat naik100% setempat
    Kandungan kekal milik andatiada capaian pihak ketiga
    Hosted in GermanyGlobal Content Delivery
    Diaudit bebasTLS A+ · HTTP header A+

    Kadangkala anda hanya perlukan teks tulen daripada sesebuah PDF: memasukkan petikan ke dalam dokumen, menampal kontrak ke editor, mengindeks kandungan untuk carian atau arkib, atau menyerahkan teks kepada pembaca skrin. Alat ini membaca lapisan teks yang terbenam dalam PDF dan mengembalikannya sebagai fail .txt ringkas, tanpa fon, imej, warna, atau susun atur, hanya aksaranya.

    Susunan dibina semula halaman demi halaman: cebisan teks pada aras yang sama membentuk satu baris, dibaca dari atas ke bawah dan kiri ke kanan. Halaman dipisahkan oleh satu baris kosong, supaya hasilnya senang diguna semula, diimport atau dicari.

    Penting dan dikatakan dengan jujur: alat ini hanya mengekstrak teks yang sudah wujud sebagai lapisan teks dalam PDF. PDF yang diimbas atau yang hanya terdiri daripada foto tiada lapisan itu; di situ hasilnya kosong dan anda perlukan pengecaman PDF OCR sebagai ganti, yang mengecam huruf daripada piksel. Susun atur rumit dengan beberapa lajur, jadual, atau nota kaki pun tidak selalu boleh disusun ke urutan teks linear yang sempurna. Namun bagi PDF biasa dan sebenar (dihasilkan oleh program pejabat, pelayar, atau sistem penyusunan huruf) ekstraksi memberi teks yang bersih dan boleh diguna semula. Semuanya berjalan setempat dalam pelayar melalui pdf.js; fail anda tidak meninggalkan peranti anda.

    Data teknikal

    Data teknikal
    Format inputPDF
    Penukaran automatikPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Format outputTXT
    Pemprosesan kelompokTidak
    PemprosesanSetempat dalam pelayar (JavaScript)
    Muat naik failTiada

    Dalam 3 langkah

    1. Lepaskan PDF anda.
    2. Teks diekstrak secara automatik.
    3. Muat turun teks sebagai .txt.

    Batasan: Mengekstrak lapisan teks sedia ada sesebuah PDF dan mengembalikannya sebagai fail .txt dalam UTF-8; baris dibina semula daripada kedudukan teks. PDF yang diimbas atau hanya imej tiada lapisan teks, di situ hasilnya kosong: gunakan PDF OCR. Fon, imej, warna, dan susun atur tepat (halaman berbilang lajur, jadual) hilang atau hanya dihampiri secara linear. Buka kunci dahulu PDF berkata laluan dengan Buka kunci PDF.

    Soalan lazim

    Mengapa fail teks saya kosong?

    Berkemungkinan PDF anda ialah imbasan atau terdiri daripada imej dan tiada lapisan teks. Gunakan PDF OCR, yang mengecam teks daripada piksel.

    Adakah susun atur dikekalkan?

    Tidak. Anda mendapat teks tulen mengikut urutan bacaan. Fon, imej, lajur, dan jadual tidak dihasilkan semula dengan setia.

    Fail dalam pengekodan apa?

    UTF-8, supaya huruf beraksen dan aksara khas turut kekal dengan betul.

    Bagaimana beberapa halaman dipisahkan?

    Dengan satu baris kosong di antara muka surat.

    Adakah PDF dimuat naik?

    Tidak, pengekstrakan teks berlaku sepenuhnya setempat dalam pelayar.

    Alat berkaitan

    PDF OCR (boleh dicari) · Tukar PDF ke Word · Keluarkan halaman PDF · PDF kepada Markdown · Tukar DOCX ke HTML · Tukar DOCX ke Markdown