nl

PDF naar Word

Zet een PDF lokaal om in een bewerkbaar Word-document (DOCX): koppen, lijsten, vet/cursief, tabellen en afbeeldingen inbegrepen. Geen upload.

Verwerkt lokaal op je apparaat ...

Jouw bestanden

    Verwerkt lokaal op je apparaat ...

    0%

    Wordt mijn bestand geüpload?

    Nee. Alles draait in je browser - je bestand verlaat je apparaat nooit. Zo is dat verifieerbaar

    Geen upload100% lokaal
    Inhoud blijft bij jougeen toegang voor derden
    Hosted in GermanyGlobal Content Delivery
    Onafhankelijk getoetstTLS A+ · HTTP-headers A+

    Een PDF is een afgeronde opmaak, geen bewerkbare tekst: alinea's laten zich slecht selecteren, zinnen niet vlot herschrijven en met een tabel valt niet verder te rekenen. Dit gereedschap leest de werkelijke structuur van je PDF uit (koppen, alinea's, lijsten, tabellen, voetnoten en afbeeldingen) en bouwt daaruit lokaal op je eigen apparaat een echt DOCX-bestand in de Office Open XML-indeling, klaar om direct te openen in Word, in LibreOffice Writer of in elk ander programma dat .docx-bestanden begrijpt. Geen watermerk, geen account, geen daglimiet: de omzetting gebeurt in het browsertabblad en niet op een server.

    Op alinea- en tekenniveau blijft er veel meer behouden dan alleen vet en cursief. Koppen worden echte Word-koppen van niveau 1 tot en met 6, inclusief overzichtsniveau, zodat het navigatievenster en de automatische inhoudsopgave meteen werken. Geneste opsommingen behouden hun niveaus als een echte lijst met meerdere niveaus. Onderstrepingen en doorhalingen worden herkend aan de lijnen die daadwerkelijk op de pagina getekend zijn, superscript en subscript aan hun verschoven basislijn, en een gekleurde tekstmarkering wordt teruggebracht tot de dichtstbijzijnde van de 16 markeerkleuren die de Word-indeling kent. Verwijzingen uit de PDF worden aanklikbare Word-hyperlinks, en aantekeningen onder aan de pagina worden echte Word-voetnoten in het voetnotenbeheer, niet als losse tekst aan het einde van de pagina.

    Tabellen worden langs drie afzonderlijke wegen herkend: aan echte kaderlijnen, waarbij de kolombreedtes uit de gemeten lijngeometrie komen en eenvoudig samengevoegde cellen samengevoegd blijven; aan een duidelijk terugkerende tussenruimte tussen de kolommen wanneer de tabel helemaal geen lijnen heeft; en aan een reeks van minstens drie opeenvolgende regels van het type «veld: waarde», zoals formulier-PDF's die opleveren. Paginaformaat, staande of liggende stand, marges en het aantal tekstkolommen worden overgenomen uit de werkelijke geometrie van de pagina in plaats van uit een A4-aanname, bij elke oorspronkelijke paginagrens staat een nette pagina-einde, en afbeeldingen worden op hun plek in de leesvolgorde ingesloten met behoud van de verhouding, ook zuiver vectorieel getekende diagrammen worden als afbeelding herkend. Terugkerende kop- en voetteksten worden echte Word-kop- en voetteksten met tabstops voor links, midden en rechts; een doorlopend paginanummer wordt daarbij een levend Word-veld in plaats van een bevroren cijfer, en een terugkerend watermerk gaat mee.

    Bij de lettertypen kiest het gereedschap de directe weg: de in de bron-PDF ingesloten lettertypebestanden worden ongewijzigd overgenomen in het Word-bestand, apart voor de normale, vette, cursieve en vet-cursieve snede. Een vetgezette alinea krijgt zo de echte contouren van het letterontwerp en geen door de tekstverwerker nagerekende verdikking. Alleen daar waar de PDF helemaal geen lettertype meelevert, springt een metrisch compatibel, open gelicentieerd vervangend lettertype bij, dat eveneens in het bestand wordt ingesloten, zodat het document er ook op een andere computer zonder die lettertypen goed uitziet. Tekst buiten het Latijnse alfabet krijgt bovendien de passende schrift- en taalmarkering, zodat Word Chinees, Japans, Koreaans, Arabisch of Hebreeuws correct vormgeeft, van rechts naar links zet waar dat hoort en de spellingcontrole de juiste taal kiest.

    Veel werk zit in de PDF's die uit de toon vallen. Een dwars opgeslagen pagina wordt in haar eigen leesrichting geanalyseerd, zodat een tabel daarop niet gekanteld aankomt en een kop niet ineens verticaal komt te staan. PDF's die vanuit de browser zijn afgedrukt, bijvoorbeeld via «Afdrukken naar PDF» in Chrome of Edge, tekenen opsommingstekens als minuscule vectorvierkantjes in plaats van als tekstteken, en plakken een hele tabelrij tot één regel tekst aan elkaar: beide worden aan de geometrie herkend en weer uit elkaar gehaald in echte lijsten en losse tabelcellen. Een paginanummer wordt alleen kop- of voettekst wanneer het over de pagina's heen echt doortelt; een eenmalige regel die er alleen uitziet als een paginanummer blijft in de tekst staan, en wisselende paginakenmerken als «K-6» of «K-86» blijven behouden in plaats van als bijwerk te worden weggegooid.

    Twee dingen zegt het gereedschap je open in plaats van ze te verzwijgen. Stond er in de bron-PDF tekst achter een ondoorzichtige zwarte balk terwijl die nog steeds als tekst uitleesbaar was, de klassieke fout van wegstrepen met een overheen geschilderde rechthoek, dan gaat die tekst niet mee naar het Word-bestand en krijg je te horen op welke pagina's dat gebeurde. En dragen tekens in de PDF helemaal geen Unicode-waarde, waardoor ook kopiëren vanuit elke PDF-lezer mislukt, dan wordt hun aandeel becijferd en word je naar «PDF OCR» verwezen in plaats van met een stil gat achter te blijven. Analyse en opbouw van het bestand gebeuren volledig in het browsertabblad: je PDF verlaat je apparaat niet en na de eerste keer laden werkt het gereedschap ook offline.

    Technische gegevens

    Technische gegevens
    InvoerformatenPDF
    Automatische conversiePNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    UitvoerformaatDOCX
    BatchverwerkingNee
    VerwerkingLokaal in de browser (JavaScript)
    BestandsuploadGeen

    In 3 stappen

    1. Zet je PDF neer: er wordt niets geüpload.
    2. Structuur, tabellen, lettertypen en afbeeldingen worden lokaal herkend en in een DOCX overgenomen.
    3. Download het DOCX en werk verder in Word of LibreOffice.

    Beperkingen: Gestructureerde weergave, geen pixelnauwkeurige kopie van de PDF. Overgenomen worden: koppen met overzichtsniveau, alinea's, genummerde en ongenummerde lijsten met meerdere niveaus, vet, cursief, onderstreept, doorgehaald, superscript en subscript, tekstmarkeringen (afgerond op de Word-markeerkleuren), aanklikbare hyperlinks, echte voetnoten, afbeeldingen en vectorieel getekende diagrammen in de leesvolgorde, echte kop- en voetteksten met een levend paginanummerveld, plus paginaformaat, stand, marges en kolomaantal uit de werkelijke geometrie. Tabellen worden herkend aan kaderlijnen, aan een terugkerende kolomtussenruimte of aan regels van het type «veld: waarde»; voorlopig wordt per pagina slechts één aaneengesloten tabelgebied beoordeeld, dus meerdere apart omkaderde tabellen onder elkaar op één pagina lopen bewust als lopende tekst door in plaats van verkeerd te worden samengesteld, en sterk geneste of veelvuldig samengevoegde tabellen blijven zwak. Elke cel bevat één alinea. Verdere eerlijke grenzen: een gekleurd fragment binnen een aaneengesloten gezette tekstpassage verliest zijn eigen kleur, en een markering die daar slechts een deel van bedekt, kleurt de hele passage; een verwijzing zonder in de PDF opgeslagen doeladres wordt overgeslagen; een koppeling binnen voetnoottekst blijft niet aanklikbaar; een opsomming genest binnen een genummerde lijst neemt op haar niveau het nummerteken over (inhoud en nesting kloppen, alleen het teken niet); wisselt de koptekst per hoofdstuk, dan blijft die als gewone tekst in het document staan in plaats van een eigen koptekst per hoofdstuk te worden. Zeer kunstig vormgegeven pagina's met tekst die om afbeeldingen loopt, worden benaderd, en op pagina's met enkele duizenden lijn- of vectorelementen wordt de tabel- en grafiekherkenning overgeslagen. Gescande PDF's of PDF's met alleen afbeeldingen hebben geen tekstlaag: dan verschijnt een verwijzing naar «PDF OCR» in plaats van een leeg resultaat. Open met een wachtwoord beveiligde PDF's eerst met «PDF ontgrendelen».

    Veelgestelde vragen

    Wordt de PDF geüpload?

    Nee. De PDF wordt in het browsertabblad geopend, daar geanalyseerd en daar wordt ook het Word-bestand opgebouwd; er is geen server die het bestand ooit te zien krijgt. Na je eerste bezoek blijft het gereedschap zelfs in vliegtuigmodus werken, het eenvoudigste bewijs dat er niets wordt geüpload.

    Ziet het Word-bestand er precies zo uit als de PDF?

    Nee, en dat is bewust. Een PDF is een vaste opmaak, een Word-document is stromende tekst: een kopie punt voor punt zou in Word niet meer zinvol te bewerken zijn. Daarom wordt de betekenis overgenomen: koppen, alinea's, lijsten, tabellen, voetnoten, afbeeldingen, kop- en voetteksten, plus paginaformaat en marges. Zeer kunstig vormgegeven pagina's met tekst rond afbeeldingen worden benaderd.

    Blijven koppen echte Word-koppen?

    Ja. Regels die groter en zwaarder gezet zijn, worden herkend als koppen van niveau 1 tot en met 6 en krijgen het bijbehorende overzichtsniveau. Daardoor werken niet alleen de opmaakprofielen, maar ook het navigatievenster en de automatisch gegenereerde inhoudsopgave in Word meteen, zonder dat je zelf hoeft na te opmaken.

    Blijft het originele lettertype uit de PDF behouden?

    Ja, als de PDF het meelevert. De in de bron-PDF ingesloten lettertypebestanden worden ongewijzigd overgenomen in het Word-bestand, apart voor de normale, vette, cursieve en vet-cursieve snede. Pas als een lettertype in de PDF ontbreekt, springt een metrisch compatibel, open gelicentieerd vervangend lettertype bij, dat eveneens wordt ingesloten, zodat het document er ook goed uitziet op een computer waar die lettertypen niet geïnstalleerd zijn.

    Blijven tabellen behouden?

    Tabellen met zichtbare kaderlijnen worden echte Word-tabellen, met kolombreedtes uit de gemeten lijngeometrie en eenvoudig samengevoegde cellen intact. Ook tabellen zonder kader met een duidelijk terugkerende kolomtussenruimte en formulierregels van het type «veld: waarde» worden herkend. Voorlopig wordt per pagina slechts één aaneengesloten tabelgebied beoordeeld: staan er meerdere apart omkaderde tabellen onder elkaar, dan lopen ze bewust als lopende tekst door in plaats van verkeerd te worden samengesteld.

    Werkt dit met gedraaide of liggende pagina's?

    Ja. Een pagina die in de PDF gedraaid is opgeslagen, wordt in haar eigen leesrichting geanalyseerd en niet in die van de rest van het document. Een tabel op zo'n pagina houdt daardoor haar rijen en kolommen de goede kant op, en een kop wordt niet ten onrechte als verticaal gezette tekst behandeld.

    Worden opsommingslijsten uit een vanuit de browser afgedrukte PDF herkend?

    Ja. Bij het afdrukken naar PDF tekenen Chrome en Edge de bolletjes van een lijst niet als tekstteken maar als minuscule vectorvierkantjes, waardoor de opsommingstekens onzichtbaar zijn voor een zuivere tekstlezer. Het gereedschap herkent ze aan hun formaat en aan het feit dat ze in één kolom onder elkaar staan, en herstelt de lijst inclusief alle niveaus. Uit dezelfde bron worden aaneengeplakte tabelrijen weer in losse cellen uit elkaar gehaald.

    Worden afbeeldingen, koppelingen en voetnoten overgenomen?

    Ja, alle drie. Ingesloten afbeeldingen worden op hun plek in de leesvolgorde ingevoegd, in breedte begrensd en met de verhouding intact; ook zuiver vectorieel getekende diagrammen worden als afbeelding herkend. Verwijzingen met een opgeslagen doel worden aanklikbare Word-hyperlinks, en aantekeningen onder aan de pagina echte Word-voetnoten. Een verwijzing zonder doeladres wordt overgeslagen, en een koppeling binnen voetnoottekst blijft niet aanklikbaar.

    Wat gebeurt er met tekst die in de bron-PDF met een zwarte balk is afgedekt?

    Die gaat niet mee naar het Word-bestand. Is er weggestreept door een zwarte rechthoek over de tekst te schilderen in plaats van hem echt te verwijderen, dan blijft de tekst binnen de PDF volledig leesbaar, een veelvoorkomende fout met grote gevolgen. Het gereedschap herkent tekst die volledig achter een ondoorzichtig donker vlak ligt, laat die weg en meldt je op welke pagina's dat is opgetreden.

    Wat gebeurt er bij een gescande PDF?

    Een scan bestaat uit afbeeldingen en heeft geen tekstlaag. Het gereedschap zegt dat eerlijk en verwijst naar «PDF OCR» in plaats van een leeg Word-bestand te maken. Draagt een bestand wel tekst maar hebben de tekens geen Unicode-waarde opgeslagen, dan wordt het betrokken aandeel becijferd: dan mislukt ook het kopiëren vanuit een PDF-lezer, en OCR is de weg terug naar de tekst.

    Gerelateerde tools

    DOCX naar PDF · PDF naar EPUB · PDF naar Markdown · PDF OCR doorzoekbaar · PDF naar tekst