vi

Trích xuất bảng PDF

Nhận diện bảng trong PDF và xuất ra CSV, Excel (XLSX) hoặc JSON, có hoặc không có đường kẻ. Chạy cục bộ trong trình duyệt, không tải lên.

Đang xử lý cục bộ trên thiết bị của bạn ...

Định dạng đầu ra Định dạng đích của tệp kết quả.
  • CSV
  • Excel (XLSX)
  • JSON
Nhận diện bảng
  • Tự động
  • Có đường kẻ (lưới)
  • Không đường kẻ (khoảng cách)
Dấu phân cách
  • Dấu phẩy
  • Chấm phẩy
  • Tab

Tệp của bạn

    Đang xử lý cục bộ trên thiết bị của bạn ...

    0%

    Tệp của tôi có bị tải lên không?

    Không. Mọi thứ chạy trong trình duyệt của bạn - tệp của bạn không bao giờ rời khỏi thiết bị. Cách kiểm chứng điều này

    Không tải lên100% cục bộ
    Nội dung ở lại với bạnkhông ai khác chạm tới
    Hosted in GermanyGlobal Content Delivery
    Kiểm định độc lậpTLS A+ · HTTP header A+

    Những con số thường bị kẹt đúng ở nơi không dùng được: trong các bảng của tệp PDF. Hóa đơn, báo cáo, sao kê ngân hàng, nghiên cứu: ai cần những giá trị đó trong Excel, cơ sở dữ liệu hay tập lệnh thì cho đến nay phải gõ lại bằng tay hoặc vật lộn với các cột vỡ vụn khi dán. Công cụ này tự động nhận diện các bảng trong PDF và xuất ra với cấu trúc nguyên vẹn: CSV cho bảng tính và nhập liệu, sổ làm việc Excel (XLSX) với mỗi bảng một trang tính, hoặc JSON kèm tọa độ để xử lý trong mã.

    Việc nhận diện dùng đúng hai kỹ thuật mà các công cụ chuyên dụng nổi tiếng dựa vào: bảng có đường kẻ được nhận ra từ các đường thực sự vẽ trên trang (chế độ lưới); các đường tạo thành lưới ô và mỗi đoạn văn bản được gán vào ô của nó. Bảng không có đường kẻ được nhận ra từ căn chỉnh (chế độ khoảng cách): các khối văn bản nằm ở cùng vị trí cột qua nhiều dòng tạo thành cột, và những khoảng trống liền mạch là ranh giới cột. Chế độ tự động tìm đường kẻ trước, không có thì chuyển sang phân tích khoảng cách; cả hai chế độ cũng có thể chọn cố định. Hỗ trợ nhiều bảng và PDF nhiều trang: mỗi bảng phát hiện được xuất riêng.

    Trung thực và quan trọng: việc nhận diện đọc lớp văn bản của PDF. PDF quét hoặc chỉ gồm hình ảnh không có lớp này; khi đó công cụ nói thẳng thay vì tạo ra bảng trống hay bịa đặt. Hãy chuyển bản quét thành văn bản tìm kiếm được bằng "PDF OCR" trước, rồi mới trích xuất bảng. Bố cục phức tạp cũng có giới hạn: ô gộp hay bảng lồng nhau chỉ được xấp xỉ, không dựng lại từng điểm ảnh. Mọi thứ chạy cục bộ trong trình duyệt qua pdf.js; tệp của bạn không bao giờ rời khỏi thiết bị.

    Thông số kỹ thuật

    Thông số kỹ thuật
    Định dạng đầu vàoPDF
    Chuyển đổi tự độngPNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
    Định dạng đầu raCSV, XLSX, JSON
    Xử lý hàng loạtKhông
    Xử lýCục bộ trong trình duyệt (JavaScript)
    Tải tệp lênKhông có

    Trong 3 bước

    1. Thả tệp PDF của bạn vào.
    2. Chọn định dạng đầu ra và cách nhận diện.
    3. Tải các bảng về dưới dạng CSV, XLSX hoặc JSON.

    Giới hạn: Nhận diện bảng qua đường kẻ viền (lưới) hoặc căn chỉnh văn bản (khoảng cách) và xuất ra CSV (mỗi bảng một tệp, nhiều bảng gộp thành ZIP), XLSX (mỗi bảng một trang tính) hoặc JSON (kèm trang, ô và tọa độ theo điểm PDF). Cần lớp văn bản thật: hãy chuyển PDF quét trước bằng "PDF OCR". Ô gộp và bố cục phức tạp chỉ được xấp xỉ; trong Excel chỉ những số rõ ràng (thập phân dấu chấm) mới thành ô số. Mở PDF có mật khẩu trước bằng "Mở khóa PDF".

    Câu hỏi thường gặp

    Công cụ nhận diện bảng như thế nào?

    Bằng hai kỹ thuật: với bảng có đường kẻ, các đường được vẽ tạo thành lưới ô (chế độ lưới). Với bảng không có đường kẻ, các cột được nhận ra từ căn chỉnh văn bản và khoảng trống liền mạch (chế độ khoảng cách). Chế độ tự động tự chọn kỹ thuật phù hợp.

    Vì sao không tìm thấy bảng trong bản quét của tôi?

    Bản quét chỉ là điểm ảnh, không có lớp văn bản đọc được. Hãy chuyển PDF thành văn bản tìm kiếm được bằng "PDF OCR" trước, rồi trích xuất bảng.

    Tôi có thể xuất nhiều bảng và nhiều trang cùng lúc không?

    Có. Tất cả các trang đều được quét và mỗi bảng phát hiện được xuất riêng: thành tệp CSV riêng (nhiều tệp gộp trong ZIP), thành trang tính riêng trong tệp Excel, hoặc thành mục trong JSON.

    Bản xuất JSON chứa gì?

    Toàn bộ cấu trúc: mỗi bảng có trang, chế độ nhận diện và vị trí; mỗi ô có văn bản và khung bao theo điểm PDF (gốc ở dưới bên trái). Lý tưởng cho tập lệnh và luồng dữ liệu.

    Vì sao ô gộp không chính xác?

    Ô gộp trải trên nhiều cột không có vị trí duy nhất trong lưới; nội dung rơi vào một trong các ô liên quan, các ô còn lại để trống. Đây là phép xấp xỉ trung thực: ngay cả công cụ máy tính chuyên dụng cũng không giải quyết hoàn hảo.

    PDF của tôi có bị tải lên không?

    Không. Việc nhận diện và xuất chạy hoàn toàn cục bộ trong trình duyệt qua pdf.js; tệp không bao giờ rời khỏi thiết bị của bạn.

    Trích xuất bảng có chạy trên điện thoại hay Chromebook không?

    Có, trên mọi thiết bị có trình duyệt mới - Windows, Mac, Linux, Chromebook hay điện thoại. PDF rất lớn chỉ cần thêm thời gian và bộ nhớ trên thiết bị di động.

    Công cụ liên quan

    PDF sang văn bản · PDF OCR (tìm kiếm được) · XLSX sang CSV · CSV sang XLSX · CSV sang JSON · PDF sang Markdown