zh

PDF转Word

在本地把PDF转换为可编辑的Word文档(DOCX),保留标题、列表、加粗/斜体、表格和图片。无需上传。

正在你的设备上本地处理 ...

你的文件

    正在你的设备上本地处理 ...

    0%

    我的文件会被上传吗?

    不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证

    无需上传100% 本地处理
    内容只属于你第三方无法访问
    Hosted in GermanyGlobal Content Delivery
    经独立审计TLS A+ · 标头 A+

    PDF 是一份已经排好的版面,而不是可以编辑的文字:段落难以选中,句子无法顺畅改写,表格也没法继续计算。本工具会读出你的 PDF 的真实结构,包括标题、段落、列表、表格、脚注和图片,并在你自己的设备上据此构建一个符合 Office Open XML 规范的真正 DOCX 文件,可以直接在 Word、LibreOffice Writer 或任何能识别 .docx 的程序中打开。没有水印,不用注册,也没有每日次数限制,因为转换发生在浏览器标签页里,而不是服务器上。

    在段落和字符层面,保留下来的远不止粗体和斜体。标题会成为真正的 Word 标题,级别从 1 到 6,并带有大纲级别,因此导航窗格和自动生成的目录立刻就能使用。嵌套的项目符号列表会以真正的多级列表保留各自的层级。下划线和删除线依据页面上实际绘制的线条判定,上标和下标依据偏移的基线判定,彩色的文字突出显示则会映射到 Word 格式所能表示的 16 种突出显示颜色中最接近的一种。PDF 中的跳转会变成可以点击的 Word 超链接,页面下方的注释会作为真正的 Word 脚注进入脚注管理,而不是散落在页尾的普通文字。

    表格通过三条互不相同的途径识别:一是依据真正绘制的框线,此时列宽来自对这些线条实测的位置,简单的合并单元格也保持合并;二是当表格完全没有框线时,依据列与列之间明显反复出现的空白;三是依据连续至少三行的「字段: 值」结构,也就是表单类 PDF 常见的写法。页面尺寸、纵向或横向、页边距以及正文分栏数,都取自页面真实的几何数据,而不是先假定 A4;在每一处原始页面的分界都会放上一个干净的分页符;图片按原始比例嵌入到阅读顺序中它本来的位置,纯用矢量绘制的图表同样会被识别为插图。反复出现的页眉和页脚会成为真正的 Word 页眉页脚,并带有左、中、右三个制表位;连续的页码会成为一个活的 Word 域,而不是被冻结的数字;反复出现的水印也会一并带过来。

    在字体上,本工具走的是直路:源 PDF 中内嵌的字体程序本身会原封不动地转入 Word 文件,常规、粗体、斜体和粗斜体四种字形各自单独处理。因此一个加粗的段落得到的是字体设计本身的真实轮廓,而不是文字处理软件事后算出来的加粗。只有在 PDF 根本没有携带字体时,才会启用一款字宽兼容、采用开放许可的替代字体,它同样会被嵌入文件,这样文档在没有安装这些字体的别人的电脑上也能正确显示。拉丁字母以外的文字还会得到相应的文种与语言标记,让 Word 正确地排布中文、日文、韩文、阿拉伯文或希伯来文,在该从右往左的地方从右往左排版,拼写检查也会选对语言。

    大量工作花在了那些不合常规的 PDF 上。横向保存的页面会按它自己的阅读方向来解析,这样页面上的表格不会被转置,标题也不会突然变成竖排。从浏览器打印出来的 PDF,例如通过 Chrome 或 Edge 的「打印为 PDF」,会把列表的项目符号画成极小的矢量方块而不是文字字符,还会把一整行表格粘成一行文本:这两种情况都能依据几何位置识破,并重新拆回真正的列表和一个个单元格。只有当页码在各页之间确实继续递增时,它才会成为页眉或页脚;一行只是看起来像页码的孤立文字会留在正文里,而像「K-6」或「K-86」这类逐页变化的页面编号会被保留,而不是当作版面附属物丢弃。

    有两件事本工具会明说,而不是替你隐瞒。如果源 PDF 里有文字位于不透明的黑条之下,却依然能作为文本读出,也就是用画上去的矩形冒充涂黑的经典错误,那么这段文字不会进入 Word 文件,并且会告诉你它出现在哪些页。如果 PDF 中的字符根本没有 Unicode 值,这也正是从任何 PDF 阅读器里复制都会失败的原因,那么它们所占的比例会被量化给出,并把你引向「PDF OCR」,而不是留下一段无声的缺口。解析和文件组装完全在浏览器标签页里完成:你的 PDF 不会离开你的设备,首次加载之后本工具离线也能使用。

    技术规格

    技术规格
    输入格式PDF
    自动转换PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    输出格式DOCX
    批量处理不支持
    处理方式在浏览器中本地处理 (JavaScript)
    文件上传

    三步完成

    1. 拖入你的 PDF:不会上传任何内容。
    2. 结构、表格、字体和图片在本地识别,并转入 DOCX。
    3. 下载 DOCX,在 Word 或 LibreOffice 中继续编辑。

    限制: 这是结构化的转写,而不是对 PDF 的逐像素复制。会被转入的内容:带大纲级别的标题、段落、多级的有序和无序列表、粗体、斜体、下划线、删除线、上标和下标、文字突出显示(就近映射到 Word 的突出显示颜色)、可点击的超链接、真正的脚注、阅读顺序中的图片与矢量绘制的图表、带有活动页码域的真正页眉页脚,以及取自真实几何数据的页面尺寸、方向、页边距和分栏数。表格依据框线、反复出现的列间空白或者「字段: 值」形式的行来识别;目前每一页只评估一个连续的表格区域,因此同一页上下叠放着几个各自加框的表格时,它们会有意地当作正文流过,而不是被错误地拼成一个表,嵌套很深或大量合并单元格的表格也仍然是弱项。每个单元格包含一个段落。其他如实说明的界限:一段连续排版的文本内部若有一处彩色文字,它会失去自己的颜色,而只覆盖其中一部分的突出显示会给整段上色;PDF 中没有记录目标地址的跳转会被跳过;脚注正文里的链接不会保持可点击;嵌套在编号列表内部的项目符号列表会在该层级沿用编号标记(内容和层级正确,只有标记不同);如果页眉逐章变化,它会作为普通正文留在文档里,而不会变成每章各自的页眉。图文环绕、排版十分讲究的页面只能近似还原;线条或矢量元素多达数千的页面会跳过表格与图形识别。扫描件或纯图片的 PDF 没有文字层:这时会出现指向「PDF OCR」的提示,而不是一个空结果。受密码保护的 PDF 请先用「解锁 PDF」打开。

    常见问题

    PDF 会被上传吗?

    不会。PDF 在浏览器标签页里打开,在那里解析,Word 文件也在那里组装;根本不存在任何能看到这个文件的服务器。首次访问之后,本工具即使在飞行模式下也照常工作,这就是没有任何内容被上传的最简单证明。

    Word 文件看起来会和 PDF 一模一样吗?

    不会,这是有意为之。PDF 是固定版面,Word 文档是流动的文字:逐点复制出来的东西在 Word 里就没法有意义地编辑了。因此转过来的是内容的含义:标题、段落、列表、表格、脚注、图片、页眉页脚,以及页面尺寸和页边距。图文环绕、排版十分讲究的页面只能近似还原。

    标题会保留为真正的 Word 标题吗?

    会。排版得更大、更粗的行会被识别为 1 到 6 级标题,并获得相应的大纲级别。这样一来不只是样式可用,Word 的导航窗格和自动生成的目录也立刻能用,你不需要自己再去调整格式。

    PDF 里的原始字体会保留吗?

    会,只要 PDF 带着它。源 PDF 中内嵌的字体文件会原封不动地转入 Word 文件,常规、粗体、斜体和粗斜体四种字形各自单独处理。只有当 PDF 里缺少某款字体时,才会启用一款字宽兼容、采用开放许可的替代字体,它同样会被嵌入,这样文档在没有安装这些字体的电脑上也能正确显示。

    表格会保留吗?

    有可见框线的表格会成为真正的 Word 表格,列宽来自实测的线条位置,简单的合并单元格也完好保留。没有框线但列间空白明显反复出现的表格,以及「字段: 值」形式的表单行,同样会被识别。目前每一页只评估一个连续的表格区域:如果几个各自加框的表格上下叠放,它们会有意地当作正文流过,而不是被错误地拼成一个表。

    旋转过的页面或横向页面能处理吗?

    可以。在 PDF 中以旋转状态保存的页面,会按它自己的阅读方向解析,而不是按文档其余部分的方向。因此这种页面上的表格能保持行列方向正确,标题也不会被误当成竖排文字。

    从浏览器打印出来的 PDF,其项目符号列表能识别吗?

    能。打印为 PDF 时,Chrome 和 Edge 把列表的圆点画成极小的矢量方块而不是文字字符,这让纯文本读取看不到任何列表标记。本工具依据它们的大小以及它们对齐在同一列上的事实把它们认出来,并连同各个层级一起还原整个列表。同样来源下被粘在一起的表格行,也会重新拆成一个个单元格。

    图片、链接和脚注会转过来吗?

    三者都会。内嵌图片会插入到阅读顺序中它本来的位置,宽度设有上限,比例保持不变;纯用矢量绘制的图表同样会被识别为插图。带有记录目标的跳转会成为可点击的 Word 超链接,页面下方的注释会成为真正的 Word 脚注。没有目标地址的跳转会被跳过,脚注正文里的链接不会保持可点击。

    源 PDF 里被黑条盖住的文字会怎样?

    它不会进入 Word 文件。如果所谓的涂黑只是在文字上画了一个黑色矩形,而没有真正把文字删掉,那么这段文字在 PDF 内部依然完全可读,这是一个常见且后果严重的错误。本工具会识破完全位于不透明深色块之下的文字,把它排除在外,并告诉你这出现在哪些页上。

    遇到扫描件 PDF 会怎样?

    扫描件由图片构成,没有文字层。本工具会如实说明,并指向「PDF OCR」,而不是生成一个空的 Word 文件。如果文件确实带有文字,但其字符没有记录 Unicode 值,受影响的比例会被量化给出:这时从 PDF 阅读器复制同样会失败,而回到文字的路径就是 OCR。

    相关工具

    DOCX 转 PDF · PDF转EPUB · PDF 转 Markdown · PDF OCR 可搜索化 · PDF 转文本