Съдържанието остава у теббез достъп на трети страни
Не възниква обработка на съдържанието на файловете ти. Не ти трябва договор за обработка на данни с gottrix, за да работиш с поверителни или служебни документи.
Hosted in GermanyGlobal Content Delivery
Основни сървъри в Hetzner в Германия, глобално доставяне чрез мрежа за доставяне на съдържание (CDN). Съдържанието на файловете ти никога не се предава в този процес - то не напуска устройството ти.
PDF е завършено оформление, а не текст за редактиране: абзаците трудно се маркират, изреченията не се преписват удобно, а таблица не може да се доизчисли. Този инструмент разчита действителната структура на твоя PDF - заглавия, абзаци, списъци, таблици, бележки под линия и изображения - и изгражда от нея, направо на твоето устройство, истински файл DOCX във формат Office Open XML, готов да се отвори в Word, в LibreOffice Writer или в която и да е друга програма, разбираща файлове .docx. Без воден знак, без регистрация и без дневен лимит: преобразуването се извършва в раздела на браузъра, а не на сървър.
На ниво абзац и знак се запазва далеч повече от удебеляването и курсива. Заглавията стават истински заглавия на Word от ниво 1 до 6, заедно с нивото в структурата, така че навигационният панел и автоматичното съдържание работят веднага. Вложените списъци запазват нивата си като истински списък на няколко нива. Подчертаванията и зачертаванията се разпознават по линиите, наистина начертани на страницата, горните и долните индекси - по изместената им основна линия, а цветното маркиране на текст се свежда до най-близкия от 16-те цвята за маркиране, които форматът на Word изобщо познава. Препратките от PDF стават хипервръзки на Word, върху които може да се щракне, а бележките в долния край на страницата попадат в апарата за бележки като истински бележки под линия на Word, а не като разпилян текст в края на страницата.
Таблиците се разпознават по три отделни пътя: по действително начертани линии на рамката, като ширините на колоните идват от измерената геометрия на тези линии, а простите обединени клетки остават обединени; по ясно повтарящо се разстояние между колоните, когато таблицата няма никакви линии; и по поредица от най-малко три последователни реда от вида «поле: стойност», каквито създават PDF формулярите. Размерът на страницата, портретната или хоризонталната ориентация, полетата и броят текстови колони се вземат от действителната геометрия на страницата вместо от предположение за A4; на всяка изходна граница между страници стои чист разделител на страница, а изображенията се вграждат на мястото си в потока на четене със запазени пропорции, като и диаграмите, начертани само с вектори, се разпознават като фигури. Повтарящите се колонтитули стават истински горни и долни колонтитули на Word с табулатори за ляво, център и дясно; продължаващият номер на страница се превръща при това в живо поле на Word вместо в замразена цифра, а повтарящ се воден знак се пренася заедно с тях.
При шрифтовете инструментът поема прекия път: програмите на шрифтовете, вградени в изходния PDF, се пренасят непроменени във файла на Word, при това поотделно за нормалния, удебеления, курсивния и удебелено-курсивния разрез. Удебелен абзац получава така истинските контури на шрифтовия рисунък, а не удебеляване, доизчислено от текстообработващата програма. Само там, където PDF изобщо не носи шрифт, се намесва метрично съвместим шрифт със свободен лиценз, който също се вгражда във файла, така че документът да изглежда правилно и на чужд компютър, на който тези шрифтове не са инсталирани. Текстът извън латинската азбука получава допълнително подходящото обозначение на писменост и език, за да оформя Word правилно китайски, японски, корейски, арабски или иврит, да набира отдясно наляво там, където това е редно, и проверката на правописа да избере правилния език.
Голяма част от работата е в PDF файловете, които излизат от общия ред. Страница, запазена завъртяна, се анализира в собствената си посока на четене, за да не пристигне таблицата върху нея обърната и заглавието да не застане изведнъж вертикално. PDF файловете, отпечатани от браузъра, например чрез «Печат в PDF» в Chrome или Edge, чертаят водещите знаци на списък не като текстови знаци, а като мънички векторни квадратчета и слепват цял ред от таблица в един-единствен текстов ред: и двете се разпознават по геометрията и отново се разделят на истински списъци и на отделни клетки. Номер на страница става колонтитул само когато наистина продължава да брои през страниците; единичен ред, който само изглежда като номер на страница, остава в текста, а променящите се обозначения на страници като «K-6» или «K-86» се запазват, вместо да бъдат изхвърлени като служебен елемент.
Две неща инструментът ти казва открито, вместо да ги премълчи. Ако в изходния PDF е имало текст зад непрозрачна черна лента, но той все още е бил четим като текст - класическата грешка при заличаване с нарисуван отгоре правоъгълник - този текст не се пренася във файла на Word и научаваш на кои страници се е случило. А ако знаци в PDF изобщо не носят стойност по Unicode, заради което се проваля и копирането от която и да е програма за преглед на PDF, делът им се посочва с число и те насочват към «PDF OCR», вместо да те остави с мълчалива празнина. Анализът и изграждането на файла се извършват изцяло в раздела на браузъра: твоят PDF не напуска устройството ти, а след първото зареждане инструментът работи и без връзка.
Структурата, таблиците, шрифтовете и изображенията се разпознават локално и се пренасят в DOCX.
Изтегли DOCX и продължи да го редактираш в Word или LibreOffice.
Ограничения: Структурно предаване, а не копие на PDF пиксел по пиксел. Пренасят се: заглавия с ниво в структурата, абзаци, номерирани и неномерирани списъци на няколко нива, удебелено, курсив, подчертано, зачертано, горни и долни индекси, маркиране на текст (закръглено до цветовете за маркиране на Word), хипервръзки за щракване, истински бележки под линия, изображения и векторни диаграми в потока на четене, истински колонтитули с живо поле за номер на страница, както и формат на страницата, ориентация, полета и брой колони от действителната геометрия. Таблиците се разпознават по линии на рамката, по повтарящо се разстояние между колоните или по редове от вида «поле: стойност»; засега на страница се оценява само една свързана област с таблица, така че няколко отделно оградени таблици една под друга на една и съща страница умишлено минават като обикновен текст, вместо да бъдат сглобени погрешно, а силно вложените или многократно обединените таблици остават слабо място. Всяка клетка съдържа един абзац. Други честни ограничения: цветен откъс вътре в непрекъснато набран текстов участък губи собствения си цвят, а маркиране, което покрива само част от него, оцветява целия участък; препратка без запазен в PDF адрес на целта се пропуска; връзка вътре в текста на бележка под линия не остава за щракване; списък с водещи знаци, вложен в номериран, приема на своето ниво номерирания знак (съдържанието и вложеността са верни, само знакът не е); ако колонтитулът се сменя за всяка глава, той остава като обикновен текст в документа, вместо да стане отделен колонтитул за всяка глава. Страниците с много изпипано оформление, при които текстът обтича фигурите, се предават приблизително, а на страници с няколко хиляди линейни или векторни елемента разпознаването на таблици и графика се пропуска. Сканираните PDF файлове или тези само с изображения нямат текстов слой: тогава се появява указание към «PDF OCR» вместо празен резултат. Защитените с парола PDF файлове отвори първо с «Отключване на PDF».
Чести въпроси
Качва ли се PDF файлът на сървър?
Не. PDF се отваря в раздела на браузъра, анализира се там и там се изгражда и файлът на Word; няма никакъв сървър, който изобщо да види файла. След първото посещение инструментът продължава да работи дори в самолетен режим, което е най-простото доказателство, че нищо не се качва.
Изглежда ли файлът на Word точно като PDF?
Не и това е умишлено. PDF е фиксирано оформление, а документът на Word е течащ текст: копие точка по точка вече не би било смислено за редактиране в Word. Затова се пренася смисълът: заглавия, абзаци, списъци, таблици, бележки под линия, изображения, колонтитули, както и формат на страницата и полета. Страниците с много изпипано оформление, при които текстът обтича фигурите, се предават приблизително.
Остават ли заглавията истински заглавия на Word?
Да. Редовете, набрани по-едро и по-плътно, се разпознават като заглавия от ниво 1 до 6 и получават съответното ниво в структурата. Така работят не само стиловете, но и навигационният панел заедно с автоматично създаваното съдържание на Word - веднага и без ти самият да преформатираш каквото и да било.
Запазва ли се оригиналният шрифт от PDF?
Да, ако PDF го носи. Файловете с шрифтове, вградени в изходния PDF, се пренасят непроменени във файла на Word, поотделно за нормалния, удебеления, курсивния и удебелено-курсивния разрез. Едва когато шрифт липсва в PDF, се намесва метрично съвместим заместител със свободен лиценз, който също се вгражда, така че документът да изглежда правилно и на компютър, на който тези шрифтове не са инсталирани.
Запазват ли се таблиците?
Таблиците с видими линии на рамката стават истински таблици на Word, с ширини на колоните от измерената геометрия и с непокътнати прости обединения на клетки. Разпознават се и таблици без рамка с ясно повтарящо се разстояние между колоните, както и редове от формуляр от вида «поле: стойност». Засега на страница се оценява само една свързана област с таблица: ако няколко отделно оградени таблици стоят една под друга, те умишлено минават като обикновен текст, вместо да бъдат сглобени погрешно.
Работи ли това със завъртени или хоризонтални страници?
Да. Страница, запазена завъртяна в PDF, се анализира в собствената си посока на четене, а не в посоката на останалата част от документа. Таблица на такава страница запазва благодарение на това редовете и колоните си в правилната посока, а заглавие не се приема погрешно за вертикално набран текст.
Разпознават ли се списъците с водещи знаци в PDF, отпечатан от браузъра?
Да. При печат в PDF Chrome и Edge чертаят точките на списък не като текстови знаци, а като мънички векторни квадратчета, заради което водещите знаци са невидими за чист текстов четец. Инструментът ги разпознава по размера им и по това, че се подреждат в една колона, и възстановява списъка заедно с всичките му нива. От същия източник слепените редове на таблица отново се разделят на отделни клетки.
Пренасят ли се изображенията, връзките и бележките под линия?
Да, и трите. Вградените изображения се вмъкват на мястото си в потока на четене, с ограничена ширина и запазени пропорции; и диаграмите, начертани само с вектори, се разпознават като фигури. Препратките със запазена цел стават хипервръзки на Word за щракване, а бележките в долния край на страницата - истински бележки под линия на Word. Препратка без адрес на целта се пропуска, а връзка вътре в текста на бележка не остава за щракване.
Какво става с текст, покрит с черна лента в изходния PDF?
Той не се пренася във файла на Word. Ако заличаването е направено чрез нарисуван върху текста черен правоъгълник, вместо той наистина да бъде премахнат, текстът остава напълно четим вътре в PDF - честа грешка с тежки последици. Инструментът разпознава текста, който е изцяло зад непрозрачна тъмна повърхност, оставя го настрана и ти съобщава на кои страници се е случило.
Какво става със сканиран PDF?
Сканирането се състои от изображения и няма текстов слой. Инструментът казва това честно и насочва към «PDF OCR», вместо да създаде празен файл на Word. Ако файл все пак носи текст, но знаците му нямат запазена стойност по Unicode, засегнатият дял се посочва с число: тогава се проваля и копирането от програма за преглед на PDF, а пътят обратно към текста е OCR.
Само с вашето съгласие измерваме употребата анонимно чрез бисквитки, за да подобряваме gottrix. Вашите файлове винаги остават локално, на вашето устройство. Поверителност