vi

PDF sang văn bản

Trích lớp văn bản của một PDF thành tệp .txt thuần, để sao chép, dùng lại hoặc tìm kiếm. Cục bộ, không tải lên.

Đang xử lý cục bộ trên thiết bị của bạn ...

Tệp của bạn

    Đang xử lý cục bộ trên thiết bị của bạn ...

    0%

    Tệp của tôi có bị tải lên không?

    Không. Mọi thứ chạy trong trình duyệt của bạn - tệp của bạn không bao giờ rời khỏi thiết bị. Cách kiểm chứng điều này

    Không tải lên100% cục bộ
    Nội dung ở lại với bạnkhông ai khác chạm tới
    Hosted in GermanyGlobal Content Delivery
    Kiểm định độc lậpTLS A+ · HTTP header A+

    Thứ tự được khôi phục theo từng trang: các đoạn văn bản cùng độ cao tạo thành một dòng, đọc từ trên xuống dưới và từ trái sang phải. Các trang được ngăn cách bằng một dòng trống, giúp kết quả dễ dàng xử lý tiếp, nhập vào ứng dụng khác hoặc tìm kiếm.

    Thông số kỹ thuật

    Thông số kỹ thuật
    Định dạng đầu vàoPDF
    Chuyển đổi tự độngPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Định dạng đầu raTXT
    Xử lý hàng loạtKhông
    Xử lýCục bộ trong trình duyệt (JavaScript)
    Tải tệp lênKhông có

    Trong 3 bước

    1. Thả tệp PDF của bạn.
    2. Văn bản được trích xuất tự động.
    3. Tải văn bản về dưới dạng .txt.

    Giới hạn: Trích lớp văn bản sẵn có của một PDF và trả về dưới dạng tệp .txt theo UTF-8; các dòng được dựng lại từ vị trí văn bản. PDF quét hoặc chỉ có ảnh thì không có lớp văn bản, ở đó kết quả sẽ trống: hãy dùng PDF OCR. Phông chữ, hình ảnh, màu sắc và bố cục chính xác (trang nhiều cột, bảng) bị mất hoặc chỉ được xấp xỉ theo kiểu tuyến tính. Hãy mở khóa các PDF có mật khẩu trước bằng Mở khóa PDF.

    Câu hỏi thường gặp

    Vì sao tệp văn bản của tôi rỗng?

    Có lẽ PDF của bạn là bản quét hoặc gồm các hình ảnh và không có lớp văn bản. Hãy dùng PDF OCR, nó nhận ra văn bản từ các điểm ảnh.

    Bố cục có được giữ không?

    Không. Bạn nhận được văn bản thuần theo thứ tự đọc. Phông chữ, hình ảnh, cột và bảng không được tái hiện đúng nguyên bản.

    Tệp ở bảng mã nào?

    UTF-8, nhờ đó các ký tự có dấu và ký tự đặc biệt vẫn được giữ đúng.

    Nhiều trang được tách thế nào?

    Bằng một dòng trống giữa các trang.

    PDF có bị tải lên không?

    Không, việc trích văn bản diễn ra hoàn toàn cục bộ trong trình duyệt.

    Công cụ liên quan

    PDF OCR (tìm kiếm được) · PDF sang Word · Trích xuất trang PDF · PDF sang Markdown · DOCX sang HTML · DOCX sang Markdown