Không có hoạt động xử lý nội dung tệp của bạn trên bất kỳ máy chủ nào. Bạn không cần ký thỏa thuận xử lý dữ liệu với gottrix để làm việc với tài liệu mật hay tài liệu công việc.
Hosted in GermanyGlobal Content Delivery
Máy chủ gốc đặt tại Hetzner ở Đức, phân phối trên toàn cầu qua mạng phân phối nội dung (CDN). Nội dung tệp của bạn không bao giờ được truyền đi trong quá trình này - tệp không bao giờ rời khỏi thiết bị của bạn.
PDF đã scan về cơ bản là một chồng hình ảnh: bạn thấy văn bản nhưng không thể chọn, tìm kiếm hay sao chép nó. OCR (nhận dạng ký tự quang học) đọc các ký tự từ hình ảnh và đặt chúng dưới dạng lớp văn bản ẩn chính xác phía trên các trang. Giao diện vẫn giữ nguyên, nhưng PDF trở nên có thể tìm kiếm và văn bản có thể chọn được - đúng như những gì cơ quan, kho lưu trữ và tìm kiếm toàn văn cần.
Chọn đầu ra: PDF có thể tìm kiếm (các trang gốc cộng lớp văn bản) hoặc văn bản thuần dưới dạng TXT. Đặt ngôn ngữ tài liệu từ danh sách - 113 ngôn ngữ từ tiếng Việt và tiếng Anh qua tiếng Nga, Ả Rập và Hindi đến tiếng Nhật, Hàn và Trung, mỗi ngôn ngữ bằng tên bản địa - để ký tự được nhận dạng chính xác. Mọi thứ chạy trên trình duyệt qua WebAssembly: cùng công cụ Tesseract mã nguồn mở như công cụ "Hình ảnh sang văn bản", áp dụng từng trang trên toàn bộ PDF. Lần đầu sử dụng, trình duyệt tải xuống một lần công cụ và mô hình ngôn ngữ đã chọn (vài MB, same-origin); sau đó hoạt động ngoại tuyến.
Công cụ này dành cho PDF đã scan hoặc dựa trên hình ảnh. Nhận dạng phụ thuộc nhiều vào chất lượng scan: các trang sắc nét, thẳng, độ tương phản cao với văn bản in được nhận dạng rất tốt; nghiêng hoặc mờ thì kém hơn nhiều; chữ viết tay không đáng tin cậy. Trong PDF có thể tìm kiếm, mỗi trang được nhúng lại dưới dạng hình ảnh - PDF đã có văn bản thực không cần OCR. Kiểm tra kết quả với số và tên riêng.
Nhận dạng chữ thường là lãnh địa của đám mây: các dịch vụ OCR nổi tiếng tải từng bản quét lên máy chủ của họ để xử lý - mà lại chính là những tài liệu như hợp đồng, giấy tờ y tế hay giấy tờ tùy thân. Ở đây toàn bộ quá trình nhận dạng chạy bằng Tesseract dưới dạng WebAssembly trong trình duyệt của bạn, và cả 113 gói ngôn ngữ đều do chính gottrix lưu trữ - trong lúc nhận dạng không có gì được tải từ bên thứ ba. Danh sách ngôn ngữ còn khởi động với lựa chọn sẵn theo ngôn ngữ giao diện của bạn. Miễn phí, không cần tài khoản và không giới hạn trang.
Chọn đầu ra (PDF có thể tìm kiếm hoặc văn bản) và ngôn ngữ từ danh sách.
Tải xuống PDF có thể tìm kiếm hoặc TXT.
Giới hạn: Dành cho PDF ĐÃ SCAN/dựa trên hình ảnh: làm cho PDF có thể tìm kiếm qua OCR (lớp văn bản ẩn) hoặc trả về văn bản thuần. Nhận dạng văn bản IN trong 113 ngôn ngữ và nhiều chữ viết; chữ viết tay không đáng tin cậy. Lưu ý: lớp văn bản ẩn trong PDF có thể tìm kiếm bao phủ chữ Latin với đầy đủ dấu phụ (23 trong số 113 ngôn ngữ, ví dụ tiếng Ba Lan, tiếng Séc, tiếng Việt, tiếng Thổ Nhĩ Kỳ), chữ Hy Lạp và chữ Cyrillic. Ký tự của các hệ chữ khác (ví dụ CJK, Ả Rập, Do Thái, Devanagari, Thái) được cố ý bỏ qua ở đó thay vì bị hiển thị sai lệch; với các chữ viết đó, đầu ra "Chỉ văn bản (TXT)" trả về toàn bộ văn bản đã nhận dạng. Trong PDF có thể tìm kiếm, mỗi trang được nhúng lại dưới dạng hình ảnh nên bố cục được giữ nguyên nhưng tệp có thể lớn hơn; PDF đã có văn bản thực không cần OCR. Nhận dạng không hoàn hảo - kiểm tra đặc biệt số và tên riêng. Công cụ và mô hình ngôn ngữ đã chọn được tải xuống một lần (vài MB, same-origin), sau đó dùng được ngoại tuyến. PDF lớn cần thời gian và bộ nhớ tùy theo số trang và thiết bị.
Câu hỏi thường gặp
PDF của tôi có bị tải lên không?
Không. Kết xuất và nhận dạng chạy hoàn toàn cục bộ trên trình duyệt (WebAssembly); PDF không bao giờ rời khỏi thiết bị của bạn - lợi thế quyết định cho hợp đồng và thư chính thức.
PDF có thể tìm kiếm là gì?
Trang trông giống bản scan, nhưng bên dưới có một lớp văn bản ẩn. Nhờ đó bạn có thể tìm kiếm trong PDF, chọn và sao chép văn bản - trong khi giao diện hình ảnh vẫn giữ nguyên.
Bố cục có được giữ nguyên không?
Có. Mỗi trang được nhúng dưới dạng hình ảnh của trang gốc, với lớp văn bản ẩn căn chỉnh phía trên. Giao diện không thay đổi, mặc dù tệp có thể tăng kích thước một chút.
Có nhận dạng được chữ viết tay hoặc ngôn ngữ khác không?
Ngôn ngữ khác thì có: hơn 100 ngôn ngữ (kể cả Ả Rập, Nga, Hindi, Nhật, Hàn, Trung). Chữ viết tay không được nhận dạng đáng tin cậy, chỉ văn bản in. Lớp văn bản của PDF có thể tìm kiếm bao phủ chữ Latin với đầy đủ dấu phụ, chữ Hy Lạp và chữ Cyrillic; với CJK, Ả Rập, Do Thái, Devanagari hoặc Thái, hãy dùng đầu ra "Chỉ văn bản (TXT)" chứa toàn bộ văn bản đã nhận dạng.
Nhận dạng chữ hỗ trợ bao nhiêu ngôn ngữ?
113 - từ tiếng Việt, tiếng Anh và tiếng Đức qua tiếng Ả Rập, Hindi và Thái đến tiếng Nhật, Hàn và Trung. Mỗi ngôn ngữ hiện trong danh sách bằng chính tên của nó, và mọi gói ngôn ngữ đều do chính gottrix lưu trữ, không phải bên thứ ba.
OCR PDF có miễn phí không, có giới hạn trang không?
Có, hoàn toàn miễn phí - không tài khoản, không dấu chìm và không giới hạn trang hay giới hạn theo ngày. Nhiều trang chỉ đơn giản là tốn thời gian tương ứng, vì chính thiết bị của bạn tính toán việc nhận dạng.
Vì sao nhận dạng cục bộ tốt hơn cho bản quét bí mật?
Vì bản quét không bao giờ rời thiết bị của bạn: không tải lên, không xử lý trên máy chủ, không bản sao trong đám mây của người khác. Sau lần tải đầu tiên, nhận dạng còn chạy được cả khi ngoại tuyến - bằng chứng mạnh nhất rằng không có gì được truyền đi.
Chỉ khi có sự đồng ý của bạn, chúng tôi mới đo lường mức sử dụng ẩn danh qua cookie để cải thiện gottrix. Tệp của bạn luôn nằm cục bộ trên thiết bị của bạn. Quyền riêng tư