Không có hoạt động xử lý nội dung tệp của bạn trên bất kỳ máy chủ nào. Bạn không cần ký thỏa thuận xử lý dữ liệu với gottrix để làm việc với tài liệu mật hay tài liệu công việc.
Hosted in GermanyGlobal Content Delivery
Máy chủ gốc đặt tại Hetzner ở Đức, phân phối trên toàn cầu qua mạng phân phối nội dung (CDN). Nội dung tệp của bạn không bao giờ được truyền đi trong quá trình này - tệp không bao giờ rời khỏi thiết bị của bạn.
PDF là một bố cục đã hoàn thiện chứ không phải văn bản có thể chỉnh sửa: đoạn văn khó bôi chọn, câu chữ không viết lại được cho suôn sẻ, còn bảng thì không tính tiếp được. Công cụ này đọc ra cấu trúc thật sự trong tệp PDF của bạn, gồm tiêu đề, đoạn văn, danh sách, bảng, chú thích cuối trang và hình ảnh, rồi dựng từ đó một tệp DOCX thực thụ theo định dạng Office Open XML, ngay trên thiết bị của bạn. Tệp ấy mở được thẳng trong Word, trong LibreOffice Writer hay bất kỳ chương trình nào khác hiểu tệp .docx. Không hình mờ, không tài khoản, không giới hạn mỗi ngày, bởi việc chuyển đổi diễn ra trong thẻ trình duyệt chứ không phải trên máy chủ.
Ở mức đoạn văn và ký tự, những gì giữ lại được nhiều hơn hẳn chỉ chữ đậm và chữ nghiêng. Tiêu đề trở thành tiêu đề Word thực thụ từ cấp 1 đến cấp 6, kèm theo cấp phân cấp, nhờ vậy khung điều hướng và mục lục tự động hoạt động được ngay. Danh sách gạch đầu dòng lồng nhau giữ nguyên các cấp của mình dưới dạng danh sách nhiều cấp thực thụ. Gạch chân và gạch ngang chữ được nhận ra từ những nét thật sự vẽ trên trang, chữ trên và chữ dưới từ đường cơ sở bị dịch, còn phần tô sáng bằng màu được ánh xạ sang màu gần nhất trong 16 màu tô sáng mà định dạng Word biết đến. Liên kết trong PDF trở thành siêu liên kết Word bấm được, và ghi chú ở chân trang vào thẳng bộ phận chú thích như chú thích cuối trang Word thực thụ, chứ không phải chữ rời rạc ở cuối trang.
Bảng được nhận ra theo ba đường riêng biệt: theo những nét kẻ thật sự được vẽ, khi đó bề rộng cột lấy từ vị trí đo được của chính các nét kẻ ấy và những ô gộp đơn giản vẫn ở trạng thái gộp; theo khoảng trắng giữa các cột lặp lại rõ rệt khi bảng hoàn toàn không có nét kẻ nào; và theo một chuỗi ít nhất ba dòng liên tiếp dạng «trường: giá trị», kiểu mà các tệp PDF biểu mẫu hay tạo ra. Khổ trang, hướng dọc hay ngang, lề và số cột chữ đều lấy từ hình học thật của trang chứ không phải từ giả định A4; ở mỗi ranh giới trang gốc có một dấu ngắt trang gọn gàng; hình ảnh được nhúng đúng chỗ trong mạch đọc và giữ nguyên tỷ lệ, cả những biểu đồ vẽ thuần bằng vector cũng được nhận là hình minh họa. Đầu trang và chân trang lặp lại trở thành đầu trang và chân trang Word thực thụ với điểm dừng tab trái, giữa và phải; số trang chạy liên tục trở thành một trường Word sống động thay vì con số bị đóng băng; hình mờ lặp lại cũng được mang theo.
Về phông chữ, công cụ đi đường thẳng: chính các chương trình phông nhúng trong tệp PDF nguồn được chuyển nguyên vẹn sang tệp Word, tách riêng cho kiểu thường, đậm, nghiêng và đậm nghiêng. Nhờ vậy một đoạn in đậm nhận được đường nét thật của bản thiết kế chữ chứ không phải phần làm dày do trình soạn thảo tính thêm. Chỉ ở chỗ nào tệp PDF hoàn toàn không mang phông thì mới có một phông thay thế tương thích về kích thước chữ và giấy phép mở bước vào, và phông đó cũng được nhúng vào tệp, để tài liệu vẫn hiện đúng trên máy người khác không cài những phông ấy. Chữ ngoài bảng chữ cái Latinh còn được gắn thêm dấu hiệu hệ chữ viết và ngôn ngữ phù hợp, để Word tạo hình đúng cho tiếng Trung, tiếng Nhật, tiếng Hàn, tiếng Ả Rập hay tiếng Hebrew, xếp từ phải sang trái ở nơi cần thiết, và bộ kiểm tra chính tả chọn đúng ngôn ngữ.
Phần lớn công sức nằm ở những tệp PDF nằm ngoài khuôn khổ thông thường. Một trang được lưu nằm ngang sẽ được phân tích theo chiều đọc của chính nó, để bảng trên trang ấy không đến nơi trong trạng thái bị hoán vị và tiêu đề không bỗng dưng đứng dọc. Những tệp PDF in ra từ trình duyệt, chẳng hạn qua «In sang PDF» trong Chrome hay Edge, vẽ dấu đầu dòng thành các ô vuông vector cực nhỏ thay vì ký tự chữ, và dán cả một hàng bảng thành một dòng chữ duy nhất: cả hai đều bị nhận ra qua hình học rồi tách trở lại thành danh sách thực thụ và từng ô riêng. Số trang chỉ trở thành đầu trang hay chân trang khi nó thật sự tăng tiếp qua các trang; một dòng đơn lẻ chỉ trông giống số trang thì vẫn nằm lại trong nội dung, còn các ký hiệu trang thay đổi như «K-6» hay «K-86» được giữ lại chứ không bị vứt đi như phần phụ trợ.
Có hai điều công cụ nói thẳng với bạn thay vì giấu đi. Nếu trong tệp PDF nguồn có chữ nằm sau một thanh đen không trong suốt nhưng vẫn đọc ra được dưới dạng văn bản, tức là lỗi kinh điển khi bôi đen bằng cách vẽ một hình chữ nhật lên trên, thì phần chữ ấy không được đưa sang tệp Word và bạn được cho biết chuyện đó xảy ra ở những trang nào. Còn nếu các ký tự trong PDF hoàn toàn không mang giá trị Unicode, tình trạng cũng khiến việc sao chép từ bất kỳ trình xem PDF nào thất bại, thì tỷ lệ của chúng được nêu bằng con số và bạn được chỉ sang «PDF OCR» thay vì bị bỏ lại với một khoảng trống lặng lẽ. Việc phân tích và dựng tệp diễn ra trọn vẹn trong thẻ trình duyệt: tệp PDF của bạn không rời khỏi thiết bị, và sau lần tải đầu tiên thì công cụ vẫn dùng được khi không có mạng.
Thả tệp PDF của bạn vào: không có gì được tải lên.
Cấu trúc, bảng, phông chữ và hình ảnh được nhận diện ngay tại máy rồi chuyển sang DOCX.
Tải DOCX về và tiếp tục chỉnh sửa trong Word hoặc LibreOffice.
Giới hạn: Đây là bản chuyển theo cấu trúc, không phải bản sao PDF theo từng điểm ảnh. Những gì được chuyển sang: tiêu đề kèm cấp phân cấp, đoạn văn, danh sách đánh số và gạch đầu dòng nhiều cấp, chữ đậm, nghiêng, gạch chân, gạch ngang, chữ trên và chữ dưới, phần tô sáng chữ (làm tròn về các màu tô sáng của Word), siêu liên kết bấm được, chú thích cuối trang thực thụ, hình ảnh và biểu đồ vector trong mạch đọc, đầu trang và chân trang thực thụ với trường số trang sống động, cùng khổ trang, hướng, lề và số cột lấy từ hình học thật. Bảng được nhận ra theo nét kẻ, theo khoảng trắng giữa cột lặp lại hoặc theo các dòng dạng «trường: giá trị»; hiện tại mỗi trang chỉ đánh giá một vùng bảng liền mạch, nên nhiều bảng có khung riêng xếp chồng trên cùng một trang sẽ cố ý chảy qua như văn bản thường thay vì bị ghép sai, còn bảng lồng sâu hoặc gộp ô nhiều vẫn là điểm yếu. Mỗi ô chứa một đoạn văn. Những giới hạn thành thật khác: một đoạn chữ màu nằm bên trong một mạch chữ được xếp liền sẽ mất màu riêng của nó, và phần tô sáng chỉ phủ một phần mạch đó sẽ tô cả mạch; liên kết không có địa chỉ đích lưu trong PDF sẽ bị bỏ qua; liên kết nằm trong nội dung chú thích cuối trang không còn bấm được; danh sách gạch đầu dòng lồng bên trong danh sách đánh số sẽ mang ký hiệu đánh số ở cấp của nó (nội dung và mức lồng đều đúng, chỉ ký hiệu là khác); nếu đầu trang đổi theo từng chương thì nó nằm lại như văn bản thường trong tài liệu chứ không thành đầu trang riêng cho từng chương. Những trang dàn dựng rất công phu với chữ chảy quanh hình chỉ được tái tạo gần đúng, và ở những trang có vài nghìn phần tử nét kẻ hoặc vector thì việc nhận diện bảng và đồ họa được bỏ qua. Tệp PDF quét hoặc chỉ gồm hình ảnh không có lớp chữ: khi đó xuất hiện chỉ dẫn sang «PDF OCR» thay vì một kết quả rỗng. Với tệp PDF được bảo vệ bằng mật khẩu, hãy mở trước bằng «Mở khóa PDF».
Câu hỏi thường gặp
Tệp PDF có được tải lên máy chủ không?
Không. Tệp PDF được mở trong thẻ trình duyệt, được phân tích ở đó và tệp Word cũng được dựng ở đó; không hề có máy chủ nào từng nhìn thấy tệp của bạn. Sau lần truy cập đầu tiên, công cụ vẫn chạy ngay cả ở chế độ máy bay, và đó là bằng chứng đơn giản nhất rằng không có gì được tải lên.
Tệp Word có trông giống hệt tệp PDF không?
Không, và đó là chủ ý. PDF là bố cục cố định, còn tài liệu Word là văn bản chảy: một bản sao từng điểm một sẽ không còn chỉnh sửa được một cách có ý nghĩa trong Word. Vì thế thứ được chuyển sang là phần ý nghĩa: tiêu đề, đoạn văn, danh sách, bảng, chú thích cuối trang, hình ảnh, đầu trang và chân trang, cùng khổ trang và lề. Những trang dàn dựng rất công phu với chữ chảy quanh hình chỉ được tái tạo gần đúng.
Tiêu đề có giữ nguyên là tiêu đề Word thực thụ không?
Có. Những dòng được xếp chữ lớn hơn và đậm hơn sẽ được nhận là tiêu đề từ cấp 1 đến cấp 6 và nhận cấp phân cấp tương ứng. Nhờ vậy không chỉ các kiểu định dạng hoạt động, mà cả khung điều hướng lẫn mục lục do Word tự sinh cũng dùng được ngay, bạn không phải tự chỉnh lại định dạng.
Phông chữ gốc trong PDF có được giữ lại không?
Có, nếu tệp PDF mang theo phông đó. Các tệp phông nhúng trong PDF nguồn được chuyển nguyên vẹn sang tệp Word, tách riêng cho kiểu thường, đậm, nghiêng và đậm nghiêng. Chỉ khi PDF thiếu một phông nào đó thì mới có phông thay thế tương thích về kích thước chữ và giấy phép mở bước vào, và phông đó cũng được nhúng, để tài liệu vẫn hiện đúng trên máy không cài những phông ấy.
Bảng có được giữ lại không?
Bảng có nét kẻ nhìn thấy được sẽ trở thành bảng Word thực thụ, với bề rộng cột lấy từ vị trí nét kẻ đo được và các ô gộp đơn giản còn nguyên. Bảng không nét kẻ nhưng có khoảng trắng giữa cột lặp lại rõ rệt, cùng những dòng biểu mẫu dạng «trường: giá trị», cũng được nhận ra. Hiện tại mỗi trang chỉ đánh giá một vùng bảng liền mạch: nếu nhiều bảng có khung riêng xếp chồng lên nhau, chúng sẽ cố ý chảy qua như văn bản thường thay vì bị ghép sai.
Có xử lý được trang xoay hoặc trang nằm ngang không?
Có. Một trang được lưu ở trạng thái xoay bên trong PDF sẽ được phân tích theo chiều đọc của chính nó chứ không theo chiều của phần còn lại trong tài liệu. Nhờ vậy bảng trên trang đó giữ đúng chiều hàng và cột, còn tiêu đề không bị hiểu nhầm thành chữ xếp dọc.
Danh sách gạch đầu dòng trong tệp PDF in từ trình duyệt có được nhận ra không?
Có. Khi in sang PDF, Chrome và Edge vẽ các chấm của danh sách không phải bằng ký tự chữ mà bằng những ô vuông vector cực nhỏ, khiến dấu đầu dòng trở nên vô hình với một trình đọc thuần văn bản. Công cụ nhận ra chúng qua kích thước và qua việc chúng thẳng hàng trong cùng một cột, rồi khôi phục danh sách cùng toàn bộ các cấp. Cũng từ nguồn đó, những hàng bảng bị dán dính vào nhau được tách trở lại thành từng ô riêng.
Hình ảnh, liên kết và chú thích cuối trang có được chuyển sang không?
Có, cả ba. Hình ảnh nhúng được chèn đúng chỗ trong mạch đọc, có giới hạn bề rộng và giữ nguyên tỷ lệ; các biểu đồ vẽ thuần bằng vector cũng được nhận là hình minh họa. Liên kết có đích được lưu sẽ trở thành siêu liên kết Word bấm được, còn ghi chú ở chân trang trở thành chú thích cuối trang Word thực thụ. Liên kết không có địa chỉ đích sẽ bị bỏ qua, và liên kết nằm trong nội dung chú thích không còn bấm được.
Chữ bị thanh đen che trong tệp PDF nguồn thì sao?
Nó không được đưa sang tệp Word. Nếu việc bôi đen được làm bằng cách vẽ một hình chữ nhật đen lên trên chữ thay vì thật sự xóa chữ đi, thì phần chữ ấy vẫn đọc được trọn vẹn bên trong tệp PDF, một lỗi phổ biến và để lại hậu quả nặng. Công cụ nhận ra phần chữ nằm hoàn toàn sau một mảng tối không trong suốt, loại nó ra và báo cho bạn biết chuyện đó xảy ra ở những trang nào.
Với tệp PDF quét thì sao?
Bản quét gồm toàn hình ảnh và không có lớp chữ. Công cụ nói thẳng điều đó và chỉ sang «PDF OCR» thay vì tạo ra một tệp Word rỗng. Nếu một tệp có mang chữ nhưng các ký tự lại không lưu giá trị Unicode, tỷ lệ bị ảnh hưởng sẽ được nêu bằng con số: khi ấy việc sao chép từ trình xem PDF cũng thất bại, và OCR là con đường quay lại với chữ.
Chỉ khi có sự đồng ý của bạn, chúng tôi mới đo lường mức sử dụng ẩn danh qua cookie để cải thiện gottrix. Tệp của bạn luôn nằm cục bộ trên thiết bị của bạn. Quyền riêng tư