Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
PDF - это готовая вёрстка, а не редактируемый текст: абзацы плохо выделяются, фразы не переписать, а таблицу не пересчитать. Этот инструмент считывает реальную структуру вашего PDF: заголовки, абзацы, списки, таблицы, сноски и изображения, и собирает из неё прямо на вашем устройстве настоящий файл DOCX в формате Office Open XML, готовый открыться в Word, в LibreOffice Writer или в любой другой программе, понимающей файлы .docx. Без водяного знака, без учётной записи и без дневного лимита: преобразование происходит во вкладке браузера, а не на сервере.
На уровне абзаца и символа сохраняется гораздо больше, чем только полужирное и курсивное начертание. Заголовки становятся настоящими заголовками Word уровней с 1 по 6 вместе с уровнем структуры, поэтому область навигации и автоматическое оглавление работают сразу. Вложенные списки сохраняют свои уровни как настоящий многоуровневый список Word. Подчёркивания и зачёркивания распознаются по линиям, действительно нарисованным на странице, надстрочные и подстрочные знаки - по смещённой базовой линии, а цветное выделение текста приводится к ближайшему из 16 цветов выделения, которые вообще известны формату Word. Ссылки из PDF становятся кликабельными гиперссылками Word, а примечания внизу страницы попадают в аппарат сносок как настоящие сноски Word, а не как разрозненный текст в конце страницы.
Таблицы распознаются тремя разными путями: по реально прочерченным линиям рамки, причём ширина столбцов берётся из измеренной геометрии этих линий, а простые объединённые ячейки остаются объединёнными; по чётко повторяющемуся промежутку между столбцами, если у таблицы нет ни одной линии; и по последовательности не менее чем из трёх идущих подряд строк вида «поле: значение», какие создают PDF-формы. Размер страницы, книжная или альбомная ориентация, поля и число текстовых колонок берутся из реальной геометрии страницы, а не из предположения об A4; на каждой исходной границе страниц стоит аккуратный разрыв страницы, а изображения встраиваются на своё место в потоке чтения с сохранением пропорций, причём диаграммы, нарисованные исключительно векторами, тоже распознаются как иллюстрации. Повторяющиеся колонтитулы становятся настоящими верхними и нижними колонтитулами Word с позициями табуляции слева, по центру и справа; сквозной номер страницы превращается при этом в живое поле Word вместо застывшей цифры, а повторяющийся водяной знак переносится вместе с ними.
С шрифтами инструмент идёт прямым путём: программы шрифтов, встроенные в исходный PDF, переносятся в файл Word без изменений, причём отдельно для обычного, полужирного, курсивного и полужирного курсивного начертания. Полужирный абзац получает благодаря этому настоящие контуры шрифтового рисунка, а не утолщение, досчитанное текстовым редактором. Только там, где PDF вообще не несёт шрифта, вступает метрически совместимый шрифт с открытой лицензией, который тоже встраивается в файл, так что документ выглядит правильно и на чужом компьютере, где эти шрифты не установлены. Текст вне латинского алфавита получает дополнительно нужную разметку письменности и языка, чтобы Word правильно формировал китайский, японский, корейский, арабский или иврит, набирал справа налево там, где это уместно, а проверка орфографии выбирала верный язык.
Много работы приходится на PDF, выбивающиеся из общего ряда. Страница, сохранённая повёрнутой, разбирается в собственном направлении чтения, чтобы таблица на ней не пришла перевёрнутой, а заголовок вдруг не встал вертикально. PDF, напечатанные из браузера, например через «Печать в PDF» в Chrome или Edge, рисуют маркеры списка не текстовыми знаками, а крошечными векторными квадратами и склеивают целую строку таблицы в одну строку текста: и то и другое распознаётся по геометрии и снова разбирается на настоящие списки и отдельные ячейки. Номер страницы становится колонтитулом только тогда, когда он действительно продолжает счёт по страницам; одиночная строка, которая лишь выглядит как номер страницы, остаётся в тексте, а меняющиеся обозначения страниц вроде «K-6» или «K-86» сохраняются, а не отбрасываются как служебный элемент.
О двух вещах инструмент говорит открыто, а не умалчивает. Если в исходном PDF текст стоял за непрозрачной чёрной полосой, но по-прежнему считывался как текст, то есть классическая ошибка редактирования нарисованным поверх прямоугольником, такой текст в файл Word не переносится, и вы узнаёте, на каких страницах это случилось. А если символы в PDF вообще не несут значения Unicode, из-за чего не работает и копирование из любой программы просмотра PDF, их доля указывается числом и вас направляют к «PDF OCR» вместо того, чтобы оставить с молчаливым пробелом. Разбор и сборка файла происходят целиком во вкладке браузера: ваш PDF не покидает устройство, а после первой загрузки инструмент работает и без сети.
Перетащите свой PDF: ничего не загружается на сервер.
Структура, таблицы, шрифты и изображения распознаются локально и переносятся в DOCX.
Скачайте DOCX и продолжайте править его в Word или LibreOffice.
Ограничения: Структурная передача, а не попиксельная копия PDF. Переносятся: заголовки с уровнем структуры, абзацы, многоуровневые нумерованные и маркированные списки, полужирный, курсив, подчёркивание, зачёркивание, надстрочные и подстрочные знаки, выделения текста (округлённые до цветов выделения Word), кликабельные гиперссылки, настоящие сноски, изображения и векторные диаграммы в потоке чтения, настоящие колонтитулы с живым полем номера страницы, а также формат страницы, ориентация, поля и число колонок из реальной геометрии. Таблицы распознаются по линиям рамки, по повторяющемуся межколоночному промежутку или по строкам вида «поле: значение»; пока на страницу оценивается только одна связная область таблицы, поэтому несколько отдельно обрамлённых таблиц, стоящих на одной странице друг под другом, намеренно проходят обычным текстом, а не собираются неверно, и сильно вложенные или многократно объединённые таблицы остаются слабым местом. Каждая ячейка содержит один абзац. Другие честные ограничения: цветной фрагмент внутри непрерывно набранного отрезка текста теряет собственный цвет, а выделение, покрывающее лишь его часть, окрашивает весь отрезок; ссылка без сохранённого в PDF адреса назначения пропускается; ссылка внутри текста сноски не остаётся кликабельной; маркированный список, вложенный в нумерованный, принимает на своём уровне нумерованный знак (содержание и вложенность верны, неверен только знак); если колонтитул меняется от главы к главе, он остаётся обычным текстом документа, а не становится отдельным колонтитулом для каждой главы. Страницы очень сложной вёрстки с обтеканием текста вокруг иллюстраций передаются приближённо, а на страницах с несколькими тысячами линейных или векторных элементов распознавание таблиц и графики пропускается. У отсканированных PDF или PDF только из изображений нет текстового слоя: тогда появляется указание на «PDF OCR» вместо пустого результата. PDF, защищённые паролем, сначала откройте с помощью «Разблокировать PDF».
Частые вопросы
Загружается ли PDF на сервер?
Нет. PDF открывается во вкладке браузера, там же разбирается и там же собирается файл Word; сервера, который когда-либо увидел бы файл, попросту нет. После первого посещения инструмент продолжает работать даже в режиме полёта, и это самое простое доказательство того, что ничего никуда не отправляется.
Выглядит ли файл Word точно так же, как PDF?
Нет, и это сделано намеренно. PDF - это фиксированная вёрстка, документ Word - текущий текст: копия точка в точку уже не поддавалась бы разумному редактированию в Word. Поэтому переносится смысл: заголовки, абзацы, списки, таблицы, сноски, изображения, колонтитулы, а также формат страницы и поля. Страницы очень сложной вёрстки с обтеканием текста вокруг иллюстраций передаются приближённо.
Остаются ли заголовки настоящими заголовками Word?
Да. Строки, набранные крупнее и насыщеннее, распознаются как заголовки уровней с 1 по 6 и получают соответствующий уровень структуры. Благодаря этому работают не только стили, но и область навигации вместе с автоматически создаваемым оглавлением Word - сразу и без того, чтобы вам пришлось что-то переформатировать вручную.
Сохраняется ли исходный шрифт из PDF?
Да, если PDF его несёт. Файлы шрифтов, встроенные в исходный PDF, переносятся в файл Word без изменений, отдельно для обычного, полужирного, курсивного и полужирного курсивного начертания. Только когда шрифта в PDF нет, вступает метрически совместимая замена с открытой лицензией, которая тоже встраивается, так что документ выглядит верно и на компьютере, где эти шрифты не установлены.
Сохраняются ли таблицы?
Таблицы с видимыми линиями рамки становятся настоящими таблицами Word, с шириной столбцов из измеренной геометрии и с сохранёнными простыми объединениями ячеек. Распознаются также таблицы без рамки с чётко повторяющимся межколоночным промежутком и строки форм вида «поле: значение». Пока на страницу оценивается только одна связная область таблицы: если несколько отдельно обрамлённых таблиц стоят друг под другом, они намеренно проходят обычным текстом, а не собираются неверно.
Работает ли это с повёрнутыми или альбомными страницами?
Да. Страница, сохранённая в PDF повёрнутой, разбирается в собственном направлении чтения, а не в направлении остального документа. Таблица на такой странице благодаря этому сохраняет строки и столбцы в правильную сторону, а заголовок не принимается ошибочно за вертикально набранный текст.
Распознаются ли маркированные списки в PDF, напечатанном из браузера?
Да. При печати в PDF Chrome и Edge рисуют точки списка не текстовыми знаками, а крошечными векторными квадратами, из-за чего маркеры невидимы для чисто текстового читателя. Инструмент распознаёт их по размеру и по тому, что они выстраиваются в одну колонку, и восстанавливает список вместе со всеми его уровнями. Из того же источника склеенные строки таблицы снова разбираются на отдельные ячейки.
Переносятся ли изображения, ссылки и сноски?
Да, все три. Встроенные изображения вставляются на своё место в потоке чтения, с ограничением по ширине и сохранением пропорций; диаграммы, нарисованные исключительно векторами, тоже распознаются как иллюстрации. Ссылки с сохранённой целью становятся кликабельными гиперссылками Word, а примечания внизу страницы - настоящими сносками Word. Ссылка без адреса назначения пропускается, а ссылка внутри текста сноски не остаётся кликабельной.
Что происходит с текстом, закрытым чёрной полосой в исходном PDF?
В файл Word он не попадает. Если вместо настоящего удаления текста поверх него нарисовали чёрный прямоугольник, текст остаётся внутри PDF полностью читаемым - частая ошибка с серьёзными последствиями. Инструмент распознаёт текст, целиком находящийся за непрозрачной тёмной областью, оставляет его за бортом и сообщает вам, на каких страницах это произошло.
Что происходит с отсканированным PDF?
Скан состоит из изображений и не имеет текстового слоя. Инструмент честно говорит об этом и направляет к «PDF OCR» вместо того, чтобы создать пустой файл Word. Если файл всё же несёт текст, но у его символов не сохранено значение Unicode, затронутая доля указывается числом: тогда не работает и копирование из программы просмотра PDF, а путь обратно к тексту - это OCR.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность