ru

PDF в Word

Преобразуйте PDF локально в редактируемый документ Word (DOCX): заголовки, списки, жирный/курсив, таблицы и изображения включены. Без загрузки.

Обработка локально на вашем устройстве ...

Ваши файлы

    Обработка локально на вашем устройстве ...

    0%

    Ваши файлы так и не покинули устройство

      Продолжить с этим файлом

      Без повторной загрузки

      Эти инструменты принимают .DOCX - ваш файл передаётся напрямую.

      Загружается ли мой файл?

      Нет. Всё выполняется в вашем браузере - ваш файл никогда не покидает устройство. Как это можно проверить

      Без загрузки100% локально
      Содержимое остаётся у васнет доступа у третьих лиц
      Hosted in GermanyGlobal Content Delivery
      Независимый аудитTLS A+ · Заголовки A+

      PDF - это готовая вёрстка, а не редактируемый текст: абзацы плохо выделяются, фразы не переписать, а таблицу не пересчитать. Этот инструмент считывает реальную структуру вашего PDF: заголовки, абзацы, списки, таблицы, сноски и изображения, и собирает из неё прямо на вашем устройстве настоящий файл DOCX в формате Office Open XML, готовый открыться в Word, в LibreOffice Writer или в любой другой программе, понимающей файлы .docx. Без водяного знака, без учётной записи и без дневного лимита: преобразование происходит во вкладке браузера, а не на сервере.

      На уровне абзаца и символа сохраняется гораздо больше, чем только полужирное и курсивное начертание. Заголовки становятся настоящими заголовками Word уровней с 1 по 6 вместе с уровнем структуры, поэтому область навигации и автоматическое оглавление работают сразу. Вложенные списки сохраняют свои уровни как настоящий многоуровневый список Word. Подчёркивания и зачёркивания распознаются по линиям, действительно нарисованным на странице, надстрочные и подстрочные знаки - по смещённой базовой линии, а цветное выделение текста приводится к ближайшему из 16 цветов выделения, которые вообще известны формату Word. Ссылки из PDF становятся кликабельными гиперссылками Word, а примечания внизу страницы попадают в аппарат сносок как настоящие сноски Word, а не как разрозненный текст в конце страницы.

      Таблицы распознаются тремя разными путями: по реально прочерченным линиям рамки, причём ширина столбцов берётся из измеренной геометрии этих линий, а простые объединённые ячейки остаются объединёнными; по чётко повторяющемуся промежутку между столбцами, если у таблицы нет ни одной линии; и по последовательности не менее чем из трёх идущих подряд строк вида «поле: значение», какие создают PDF-формы. Размер страницы, книжная или альбомная ориентация, поля и число текстовых колонок берутся из реальной геометрии страницы, а не из предположения об A4; на каждой исходной границе страниц стоит аккуратный разрыв страницы, а изображения встраиваются на своё место в потоке чтения с сохранением пропорций, причём диаграммы, нарисованные исключительно векторами, тоже распознаются как иллюстрации. Повторяющиеся колонтитулы становятся настоящими верхними и нижними колонтитулами Word с позициями табуляции слева, по центру и справа; сквозной номер страницы превращается при этом в живое поле Word вместо застывшей цифры, а повторяющийся водяной знак переносится вместе с ними.

      С шрифтами инструмент идёт прямым путём: программы шрифтов, встроенные в исходный PDF, переносятся в файл Word без изменений, причём отдельно для обычного, полужирного, курсивного и полужирного курсивного начертания. Полужирный абзац получает благодаря этому настоящие контуры шрифтового рисунка, а не утолщение, досчитанное текстовым редактором. Только там, где PDF вообще не несёт шрифта, вступает метрически совместимый шрифт с открытой лицензией, который тоже встраивается в файл, так что документ выглядит правильно и на чужом компьютере, где эти шрифты не установлены. Текст вне латинского алфавита получает дополнительно нужную разметку письменности и языка, чтобы Word правильно формировал китайский, японский, корейский, арабский или иврит, набирал справа налево там, где это уместно, а проверка орфографии выбирала верный язык.

      Много работы приходится на PDF, выбивающиеся из общего ряда. Страница, сохранённая повёрнутой, разбирается в собственном направлении чтения, чтобы таблица на ней не пришла перевёрнутой, а заголовок вдруг не встал вертикально. PDF, напечатанные из браузера, например через «Печать в PDF» в Chrome или Edge, рисуют маркеры списка не текстовыми знаками, а крошечными векторными квадратами и склеивают целую строку таблицы в одну строку текста: и то и другое распознаётся по геометрии и снова разбирается на настоящие списки и отдельные ячейки. Номер страницы становится колонтитулом только тогда, когда он действительно продолжает счёт по страницам; одиночная строка, которая лишь выглядит как номер страницы, остаётся в тексте, а меняющиеся обозначения страниц вроде «K-6» или «K-86» сохраняются, а не отбрасываются как служебный элемент.

      О двух вещах инструмент говорит открыто, а не умалчивает. Если в исходном PDF текст стоял за непрозрачной чёрной полосой, но по-прежнему считывался как текст, то есть классическая ошибка редактирования нарисованным поверх прямоугольником, такой текст в файл Word не переносится, и вы узнаёте, на каких страницах это случилось. А если символы в PDF вообще не несут значения Unicode, из-за чего не работает и копирование из любой программы просмотра PDF, их доля указывается числом и вас направляют к «PDF OCR» вместо того, чтобы оставить с молчаливым пробелом. Разбор и сборка файла происходят целиком во вкладке браузера: ваш PDF не покидает устройство, а после первой загрузки инструмент работает и без сети.

      Технические данные

      Технические данные
      Входные форматыPDF
      Автоматическое преобразованиеPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      Выходной форматDOCX
      Пакетная обработкаНет
      ОбработкаЛокально в браузере (JavaScript)
      Загрузка файловОтсутствует

      В 3 шага

      1. Перетащите свой PDF: ничего не загружается на сервер.
      2. Структура, таблицы, шрифты и изображения распознаются локально и переносятся в DOCX.
      3. Скачайте DOCX и продолжайте править его в Word или LibreOffice.

      Ограничения: Структурная передача, а не попиксельная копия PDF. Переносятся: заголовки с уровнем структуры, абзацы, многоуровневые нумерованные и маркированные списки, полужирный, курсив, подчёркивание, зачёркивание, надстрочные и подстрочные знаки, выделения текста (округлённые до цветов выделения Word), кликабельные гиперссылки, настоящие сноски, изображения и векторные диаграммы в потоке чтения, настоящие колонтитулы с живым полем номера страницы, а также формат страницы, ориентация, поля и число колонок из реальной геометрии. Таблицы распознаются по линиям рамки, по повторяющемуся межколоночному промежутку или по строкам вида «поле: значение»; пока на страницу оценивается только одна связная область таблицы, поэтому несколько отдельно обрамлённых таблиц, стоящих на одной странице друг под другом, намеренно проходят обычным текстом, а не собираются неверно, и сильно вложенные или многократно объединённые таблицы остаются слабым местом. Каждая ячейка содержит один абзац. Другие честные ограничения: цветной фрагмент внутри непрерывно набранного отрезка текста теряет собственный цвет, а выделение, покрывающее лишь его часть, окрашивает весь отрезок; ссылка без сохранённого в PDF адреса назначения пропускается; ссылка внутри текста сноски не остаётся кликабельной; маркированный список, вложенный в нумерованный, принимает на своём уровне нумерованный знак (содержание и вложенность верны, неверен только знак); если колонтитул меняется от главы к главе, он остаётся обычным текстом документа, а не становится отдельным колонтитулом для каждой главы. Страницы очень сложной вёрстки с обтеканием текста вокруг иллюстраций передаются приближённо, а на страницах с несколькими тысячами линейных или векторных элементов распознавание таблиц и графики пропускается. У отсканированных PDF или PDF только из изображений нет текстового слоя: тогда появляется указание на «PDF OCR» вместо пустого результата. PDF, защищённые паролем, сначала откройте с помощью «Разблокировать PDF».

      Частые вопросы

      Загружается ли PDF на сервер?

      Нет. PDF открывается во вкладке браузера, там же разбирается и там же собирается файл Word; сервера, который когда-либо увидел бы файл, попросту нет. После первого посещения инструмент продолжает работать даже в режиме полёта, и это самое простое доказательство того, что ничего никуда не отправляется.

      Выглядит ли файл Word точно так же, как PDF?

      Нет, и это сделано намеренно. PDF - это фиксированная вёрстка, документ Word - текущий текст: копия точка в точку уже не поддавалась бы разумному редактированию в Word. Поэтому переносится смысл: заголовки, абзацы, списки, таблицы, сноски, изображения, колонтитулы, а также формат страницы и поля. Страницы очень сложной вёрстки с обтеканием текста вокруг иллюстраций передаются приближённо.

      Остаются ли заголовки настоящими заголовками Word?

      Да. Строки, набранные крупнее и насыщеннее, распознаются как заголовки уровней с 1 по 6 и получают соответствующий уровень структуры. Благодаря этому работают не только стили, но и область навигации вместе с автоматически создаваемым оглавлением Word - сразу и без того, чтобы вам пришлось что-то переформатировать вручную.

      Сохраняется ли исходный шрифт из PDF?

      Да, если PDF его несёт. Файлы шрифтов, встроенные в исходный PDF, переносятся в файл Word без изменений, отдельно для обычного, полужирного, курсивного и полужирного курсивного начертания. Только когда шрифта в PDF нет, вступает метрически совместимая замена с открытой лицензией, которая тоже встраивается, так что документ выглядит верно и на компьютере, где эти шрифты не установлены.

      Сохраняются ли таблицы?

      Таблицы с видимыми линиями рамки становятся настоящими таблицами Word, с шириной столбцов из измеренной геометрии и с сохранёнными простыми объединениями ячеек. Распознаются также таблицы без рамки с чётко повторяющимся межколоночным промежутком и строки форм вида «поле: значение». Пока на страницу оценивается только одна связная область таблицы: если несколько отдельно обрамлённых таблиц стоят друг под другом, они намеренно проходят обычным текстом, а не собираются неверно.

      Работает ли это с повёрнутыми или альбомными страницами?

      Да. Страница, сохранённая в PDF повёрнутой, разбирается в собственном направлении чтения, а не в направлении остального документа. Таблица на такой странице благодаря этому сохраняет строки и столбцы в правильную сторону, а заголовок не принимается ошибочно за вертикально набранный текст.

      Распознаются ли маркированные списки в PDF, напечатанном из браузера?

      Да. При печати в PDF Chrome и Edge рисуют точки списка не текстовыми знаками, а крошечными векторными квадратами, из-за чего маркеры невидимы для чисто текстового читателя. Инструмент распознаёт их по размеру и по тому, что они выстраиваются в одну колонку, и восстанавливает список вместе со всеми его уровнями. Из того же источника склеенные строки таблицы снова разбираются на отдельные ячейки.

      Переносятся ли изображения, ссылки и сноски?

      Да, все три. Встроенные изображения вставляются на своё место в потоке чтения, с ограничением по ширине и сохранением пропорций; диаграммы, нарисованные исключительно векторами, тоже распознаются как иллюстрации. Ссылки с сохранённой целью становятся кликабельными гиперссылками Word, а примечания внизу страницы - настоящими сносками Word. Ссылка без адреса назначения пропускается, а ссылка внутри текста сноски не остаётся кликабельной.

      Что происходит с текстом, закрытым чёрной полосой в исходном PDF?

      В файл Word он не попадает. Если вместо настоящего удаления текста поверх него нарисовали чёрный прямоугольник, текст остаётся внутри PDF полностью читаемым - частая ошибка с серьёзными последствиями. Инструмент распознаёт текст, целиком находящийся за непрозрачной тёмной областью, оставляет его за бортом и сообщает вам, на каких страницах это произошло.

      Что происходит с отсканированным PDF?

      Скан состоит из изображений и не имеет текстового слоя. Инструмент честно говорит об этом и направляет к «PDF OCR» вместо того, чтобы создать пустой файл Word. Если файл всё же несёт текст, но у его символов не сохранено значение Unicode, затронутая доля указывается числом: тогда не работает и копирование из программы просмотра PDF, а путь обратно к тексту - это OCR.

      Похожие инструменты

      DOCX в PDF · PDF в EPUB · PDF в Markdown · PDF OCR - поиск по PDF · PDF в текст