Жодної обробки вмісту ваших файлів на сервері не відбувається. Вам не потрібен договір про обробку даних із gottrix, щоб працювати з конфіденційними чи службовими документами.
Hosted in GermanyGlobal Content Delivery
Основні сервери розміщено в Hetzner у Німеччині, доставлення по всьому світу відбувається через мережу доставлення контенту (CDN). Вміст ваших файлів при цьому ніколи не передається - він не залишає ваш пристрій.
PDF - це завершена верстка, а не редагований текст: абзаци погано виділяються, речення не переписати, а таблицю не перерахувати. Цей інструмент зчитує справжню структуру вашого PDF: заголовки, абзаци, списки, таблиці, виноски та зображення, і будує з неї просто на вашому пристрої справжній файл DOCX у форматі Office Open XML, готовий відкритися у Word, у LibreOffice Writer або в будь-якій іншій програмі, яка розуміє файли .docx. Без водяного знака, без облікового запису й без денного обмеження: перетворення відбувається у вкладці браузера, а не на сервері.
На рівні абзацу та символа зберігається значно більше, ніж лише жирне й курсивне накреслення. Заголовки стають справжніми заголовками Word рівнів від 1 до 6 разом із рівнем структури, тож область навігації та автоматичний зміст працюють одразу. Вкладені списки зберігають свої рівні як справжній багаторівневий список Word. Підкреслення й закреслення розпізнаються за лініями, справді накресленими на сторінці, надрядкові та підрядкові знаки - за зміщеною базовою лінією, а кольорове виділення тексту зводиться до найближчого з 16 кольорів виділення, які взагалі відомі формату Word. Посилання з PDF стають клікабельними гіперпосиланнями Word, а примітки внизу сторінки потрапляють до апарату виносок як справжні виноски Word, а не як розрізнений текст наприкінці сторінки.
Таблиці розпізнаються трьома окремими шляхами: за справді накресленими лініями рамки, причому ширина стовпців береться зі зміряної геометрії цих ліній, а прості об'єднані комірки залишаються об'єднаними; за чітко повторюваним проміжком між стовпцями, якщо таблиця не має жодної лінії; і за послідовністю щонайменше з трьох поспіль рядків вигляду «поле: значення», які створюють PDF-форми. Розмір сторінки, книжкова чи альбомна орієнтація, поля та кількість текстових колонок беруться зі справжньої геометрії сторінки, а не з припущення про A4; на кожній вихідній межі сторінок стоїть охайний розрив сторінки, а зображення вбудовуються на своє місце в потоці читання зі збереженням пропорцій, причому діаграми, намальовані самими лише векторами, теж розпізнаються як ілюстрації. Повторювані колонтитули стають справжніми верхніми та нижніми колонтитулами Word із позиціями табуляції ліворуч, по центру та праворуч; наскрізний номер сторінки перетворюється при цьому на живе поле Word замість застиглої цифри, а повторюваний водяний знак переноситься разом із ними.
Зі шрифтами інструмент іде прямим шляхом: програми шрифтів, вбудовані у вихідний PDF, переносяться до файлу Word без змін, причому окремо для звичайного, жирного, курсивного та жирного курсивного накреслення. Жирний абзац отримує завдяки цьому справжні контури шрифтового рисунка, а не потовщення, дораховане текстовим редактором. Лише там, де PDF узагалі не несе шрифту, вступає метрично сумісний шрифт із відкритою ліцензією, який теж вбудовується у файл, тож документ виглядає правильно й на чужому комп'ютері, де ці шрифти не встановлені. Текст поза латинською абеткою отримує додатково потрібне позначення письма та мови, щоб Word правильно формував китайську, японську, корейську, арабську чи іврит, набирав справа наліво там, де це доречно, а перевірка правопису обирала правильну мову.
Багато роботи припадає на PDF, які випадають із загального ряду. Сторінка, збережена повернутою, розбирається у власному напрямку читання, щоб таблиця на ній не прийшла перевернутою, а заголовок раптом не став вертикально. PDF, надруковані з браузера, наприклад через «Друк у PDF» у Chrome чи Edge, малюють маркери списку не текстовими знаками, а крихітними векторними квадратами й склеюють цілий рядок таблиці в один рядок тексту: і те, і те розпізнається за геометрією та знову розбирається на справжні списки й окремі комірки. Номер сторінки стає колонтитулом лише тоді, коли він справді продовжує лічбу по сторінках; одиничний рядок, який лише виглядає як номер сторінки, залишається в тексті, а змінні позначення сторінок на кшталт «K-6» чи «K-86» зберігаються, а не відкидаються як службовий елемент.
Про дві речі інструмент говорить відверто, а не замовчує. Якщо у вихідному PDF текст стояв за непрозорою чорною смугою, але й далі зчитувався як текст, тобто класична помилка редагування намальованим згори прямокутником, такий текст до файлу Word не переноситься, і ви дізнаєтеся, на яких сторінках це сталося. А якщо символи в PDF узагалі не несуть значення Unicode, через що не працює й копіювання з будь-якої програми перегляду PDF, їхню частку вказують числом і скеровують вас до «PDF OCR» замість того, щоб залишити з мовчазною прогалиною. Розбір і збирання файлу відбуваються цілком у вкладці браузера: ваш PDF не залишає пристрій, а після першого завантаження інструмент працює й без мережі.
Структура, таблиці, шрифти та зображення розпізнаються локально й переносяться до DOCX.
Завантажте DOCX і редагуйте його далі у Word або LibreOffice.
Обмеження: Структурна передача, а не попіксельна копія PDF. Переносяться: заголовки з рівнем структури, абзаци, багаторівневі нумеровані й марковані списки, жирний, курсив, підкреслення, закреслення, надрядкові та підрядкові знаки, виділення тексту (округлені до кольорів виділення Word), клікабельні гіперпосилання, справжні виноски, зображення та векторні діаграми в потоці читання, справжні колонтитули з живим полем номера сторінки, а також формат сторінки, орієнтація, поля й кількість колонок зі справжньої геометрії. Таблиці розпізнаються за лініями рамки, за повторюваним міжколонковим проміжком або за рядками вигляду «поле: значення»; поки на сторінку оцінюється лише одна суцільна область таблиці, тож кілька окремо обрамлених таблиць, розміщених на одній сторінці одна під одною, навмисно проходять звичайним текстом, а не збираються хибно, і сильно вкладені чи багаторазово об'єднані таблиці залишаються слабким місцем. Кожна комірка містить один абзац. Інші чесні обмеження: кольоровий фрагмент усередині безперервно набраного відрізка тексту втрачає власний колір, а виділення, що вкриває лише його частину, забарвлює весь відрізок; посилання без збереженої в PDF адреси призначення пропускається; посилання всередині тексту виноски не залишається клікабельним; маркований список, вкладений у нумерований, переймає на своєму рівні нумерований знак (зміст і вкладеність правильні, хибний лише знак); якщо колонтитул змінюється від розділу до розділу, він залишається звичайним текстом документа, а не стає окремим колонтитулом для кожного розділу. Сторінки дуже складної верстки з обтіканням тексту навколо ілюстрацій передаються наближено, а на сторінках із кількома тисячами лінійних чи векторних елементів розпізнавання таблиць і графіки пропускається. Відскановані PDF або PDF лише із зображень не мають текстового шару: тоді з'являється вказівка на «PDF OCR» замість порожнього результату. PDF, захищені паролем, спершу відкрийте за допомогою «Розблокувати PDF».
Часті запитання
Чи вивантажується PDF на сервер?
Ні. PDF відкривається у вкладці браузера, там же розбирається і там же збирається файл Word; сервера, який колись побачив би файл, просто немає. Після першого відвідування інструмент працює навіть у режимі польоту, і це найпростіший доказ того, що нічого нікуди не надсилається.
Чи виглядає файл Word точнісінько як PDF?
Ні, і це зроблено навмисно. PDF - це закріплена верстка, документ Word - текст, що тече: копія точка в точку вже не піддавалася б розумному редагуванню у Word. Тому переноситься зміст: заголовки, абзаци, списки, таблиці, виноски, зображення, колонтитули, а також формат сторінки й поля. Сторінки дуже складної верстки з обтіканням тексту навколо ілюстрацій передаються наближено.
Чи залишаються заголовки справжніми заголовками Word?
Так. Рядки, набрані більшим і насиченішим накресленням, розпізнаються як заголовки рівнів від 1 до 6 й отримують відповідний рівень структури. Завдяки цьому працюють не лише стилі, а й область навігації разом з автоматично створюваним змістом Word - одразу і без того, щоб вам довелося щось переформатовувати вручну.
Чи зберігається початковий шрифт із PDF?
Так, якщо PDF його несе. Файли шрифтів, вбудовані у вихідний PDF, переносяться до файлу Word без змін, окремо для звичайного, жирного, курсивного та жирного курсивного накреслення. Лише коли шрифту в PDF немає, вступає метрично сумісна заміна з відкритою ліцензією, яка теж вбудовується, тож документ виглядає правильно й на комп'ютері, де ці шрифти не встановлені.
Чи зберігаються таблиці?
Таблиці з видимими лініями рамки стають справжніми таблицями Word, із шириною стовпців зі зміряної геометрії та зі збереженими простими об'єднаннями комірок. Розпізнаються також таблиці без рамки з чітко повторюваним міжколонковим проміжком і рядки форм вигляду «поле: значення». Поки на сторінку оцінюється лише одна суцільна область таблиці: якщо кілька окремо обрамлених таблиць стоять одна під одною, вони навмисно проходять звичайним текстом, а не збираються хибно.
Чи працює це з повернутими або альбомними сторінками?
Так. Сторінка, збережена у PDF повернутою, розбирається у власному напрямку читання, а не в напрямку решти документа. Таблиця на такій сторінці завдяки цьому зберігає рядки та стовпці в правильний бік, а заголовок не сприймається помилково як вертикально набраний текст.
Чи розпізнаються марковані списки у PDF, надрукованому з браузера?
Так. Під час друку в PDF Chrome і Edge малюють крапки списку не текстовими знаками, а крихітними векторними квадратами, через що маркери невидимі для суто текстового читача. Інструмент розпізнає їх за розміром і за тим, що вони вишиковуються в одну колонку, та відновлює список разом з усіма його рівнями. З того самого джерела склеєні рядки таблиці знову розбираються на окремі комірки.
Чи переносяться зображення, посилання та виноски?
Так, усі три. Вбудовані зображення вставляються на своє місце в потоці читання, з обмеженням за шириною та збереженням пропорцій; діаграми, намальовані самими лише векторами, теж розпізнаються як ілюстрації. Посилання зі збереженою ціллю стають клікабельними гіперпосиланнями Word, а примітки внизу сторінки - справжніми виносками Word. Посилання без адреси призначення пропускається, а посилання всередині тексту виноски не залишається клікабельним.
Що відбувається з текстом, закритим чорною смугою у вихідному PDF?
До файлу Word він не потрапляє. Якщо замість справжнього вилучення тексту згори намалювали чорний прямокутник, текст залишається всередині PDF повністю читаним - часта помилка з серйозними наслідками. Інструмент розпізнає текст, який цілком перебуває за непрозорою темною поверхнею, лишає його осторонь і повідомляє вам, на яких сторінках це сталося.
Що відбувається зі відсканованим PDF?
Скан складається із зображень і не має текстового шару. Інструмент чесно про це каже й скеровує до «PDF OCR» замість того, щоб створити порожній файл Word. Якщо файл усе ж несе текст, але його символи не мають збереженого значення Unicode, уражену частку вказують числом: тоді не працює й копіювання з програми перегляду PDF, а шлях назад до тексту - це OCR.
Лише за вашою згодою ми анонімно вимірюємо використання за допомогою файлів cookie, щоб покращувати gottrix. Ваші файли завжди залишаються локально, на вашому пристрої. Конфіденційність