ms

PDF kepada Markdown

Tukar lapisan teks PDF kepada Markdown secara setempat - tajuk, senarai dan perenggan dikesan daripada struktur dokumen. Tiada muat naik.

Memproses secara setempat pada peranti anda ...

Fail anda

    Memproses secara setempat pada peranti anda ...

    0%

    Adakah fail saya dimuat naik?

    Tidak. Semuanya berjalan dalam pelayar anda - fail anda tidak pernah meninggalkan peranti. Bagaimana ini boleh disahkan

    Tiada muat naik100% setempat
    Kandungan kekal milik andatiada capaian pihak ketiga
    Hosted in GermanyGlobal Content Delivery
    Diaudit bebasTLS A+ · HTTP header A+

    Markdown ialah format pilihan untuk nota, wiki, laman statik dan alat kecerdasan buatan: ringkas, boleh diversi dan boleh dibaca di mana-mana. Sesiapa yang ingin menggunakan semula kandungan PDF selama ini terpaksa menyalinnya secara manual dengan susah payah. Alat ini membaca lapisan teks PDF dan mengembalikannya sebagai Markdown dengan struktur kasar yang sudah tersusun - tajuk, senarai dan perenggan sebagai ganti satu tembok teks yang panjang.

    Struktur dikesan menggunakan heuristik: baris dengan fon yang jauh lebih besar daripada teks kandungan dijadikan tajuk (#, ## atau ###), baris yang bermula dengan tanda butiran atau nombor dijadikan senarai Markdown, dan jurang menegak yang lebih besar antara baris menandakan perenggan baru. Daripada kedudukan teks semata-mata, terhasillah dokumen Markdown yang mudah dibaca dan boleh digunakan semula - titik permulaan yang sesuai untuk anda halusi dalam editor.

    Penting dan jujur: ini ialah anggaran struktur, bukan pembinaan semula susun atur yang tepat. Jadual, halaman berbilang lajur dan pemformatan terperinci tidak dapat diambil tanpa kehilangan daripada lapisan teks. Seperti pengekstrakan teks biasa: PDF imbasan atau yang hanya mengandungi imej tidak mempunyai lapisan teks - hasilnya akan kosong dan anda perlu menggunakan PDF OCR. Semua proses berjalan secara setempat dalam pelayar melalui pdf.js; fail anda tidak meninggalkan peranti anda.

    Data teknikal

    Data teknikal
    Format inputPDF
    Penukaran automatikPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Format outputMD
    Pemprosesan kelompokTidak
    PemprosesanSetempat dalam pelayar (JavaScript)
    Muat naik failTiada

    Dalam 3 langkah

    1. Lepaskan PDF di sini.
    2. Struktur dikesan secara automatik.
    3. Muat turun Markdown sebagai fail .md.

    Batasan: Menukar lapisan teks sedia ada dalam PDF kepada Markdown (UTF-8 .md). Tajuk, senarai dan perenggan dikesan secara heuristik berdasarkan saiz fon dan jarak - anggaran struktur, bukan pembinaan semula susun atur yang tepat. Jadual dan halaman berbilang lajur hanya dihampiri secara linear. PDF imbasan atau yang mengandungi imej sahaja tidak mempunyai lapisan teks; hasilnya kosong, gunakan PDF OCR. Buka kunci PDF yang dilindungi kata laluan dahulu. Hanya teks dibaca (getTextContent dari pdf.js); imej terbenam tidak dibawa masuk ke Markdown.

    Soalan lazim

    Bagaimana tajuk dikesan?

    Berdasarkan saiz fon: baris yang jauh lebih besar daripada teks kandungan ditukar kepada #, ## atau ### bergantung pada nisbahnya.

    Adakah jadual dan lajur dikekalkan?

    Tidak. Penukaran ini merupakan anggaran struktur; jadual dan susun atur berbilang lajur hanya dihampiri secara linear, bukan dibina semula dengan tepat.

    Mengapa Markdown saya kosong?

    PDF anda mungkin hasil imbasan atau terdiri daripada imej dan tidak mempunyai lapisan teks. Gunakan PDF OCR yang mengenal pasti teks daripada piksel.

    Adakah PDF dimuat naik ke pelayan?

    Tidak. Penukaran berlaku sepenuhnya secara setempat dalam pelayar melalui pdf.js; fail tidak meninggalkan peranti anda.

    Alat berkaitan

    PDF kepada teks · PDF OCR (boleh dicari) · HTML kepada Markdown · Tukar Markdown ke PDF · Ekstrak jadual PDF · Tukar PDF ke Word