PDF轉Word
在本機把PDF轉換成可編輯的Word文件(DOCX),保留標題、清單、粗體/斜體、表格與圖片。不需上傳。
正在你的裝置上本機處理 ...
你的檔案
正在你的裝置上本機處理 ...
0%
我的檔案會被上傳嗎?
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
在本機把PDF轉換成可編輯的Word文件(DOCX),保留標題、清單、粗體/斜體、表格與圖片。不需上傳。
正在你的裝置上本機處理 ...
正在你的裝置上本機處理 ...
0%
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
PDF 是一份已經排好的版面,而不是可以編輯的文字:段落難以選取,句子無法順暢改寫,表格也沒辦法繼續運算。本工具會讀出你的 PDF 的真實結構,包含標題、段落、清單、表格、註腳與圖片,並在你自己的裝置上據此組出一個符合 Office Open XML 規範的真正 DOCX 檔,可以直接在 Word、LibreOffice Writer 或任何看得懂 .docx 的程式中開啟。沒有浮水印,不必註冊,也沒有每日次數上限,因為轉換發生在瀏覽器分頁裡,而不是伺服器上。
在段落與字元層級,保留下來的遠不只粗體與斜體。標題會成為真正的 Word 標題,層級從 1 到 6,並帶有大綱階層,因此功能窗格與自動產生的目錄立刻就能用。巢狀項目符號清單會以真正的多層級清單保留各自的階層。底線與刪除線依據頁面上實際畫出的線條判定,上標與下標依據偏移的基線判定,彩色的文字醒目提示則會對應到 Word 格式所能表示的 16 種醒目提示色彩中最接近的一種。PDF 裡的連結會變成可以點按的 Word 超連結,頁面下方的附註會成為真正的 Word 註腳並進入註腳管理,而不是散落在頁尾的一般文字。
表格透過三條彼此不同的途徑辨識:其一是依據真正畫出的框線,此時欄寬來自對這些線條實測的位置,單純的合併儲存格也維持合併;其二是當表格完全沒有框線時,依據欄與欄之間明顯反覆出現的空白;其三是依據連續至少三列的「欄位: 值」結構,也就是表單類 PDF 常見的寫法。頁面尺寸、直向或橫向、邊界以及內文分欄數,都取自頁面真實的幾何資料,而不是先假設 A4;在每一處原始頁面的交界都會放上一個乾淨的分頁符號;圖片依原比例嵌入到閱讀順序中它原本的位置,純以向量繪製的圖表同樣會被辨識為插圖。反覆出現的頁首與頁尾會成為真正的 Word 頁首頁尾,並帶有靠左、置中、靠右三個定位停駐點;連續的頁碼會成為一個活的 Word 功能變數,而不是被凍結的數字;反覆出現的浮水印也會一併帶過來。
在字型上,本工具走的是直路:來源 PDF 裡內嵌的字型程式本身會原封不動地轉入 Word 檔,一般、粗體、斜體與粗斜體四種字面各自獨立處理。因此一個加粗的段落得到的是字體設計本身的真實輪廓,而不是文書處理軟體事後算出來的加粗。只有在 PDF 根本沒有帶字型時,才會啟用一款字寬相容、採用開放授權的替代字型,它同樣會被嵌入檔案,這樣文件在沒有安裝這些字型的別人電腦上也能正確顯示。拉丁字母以外的文字還會取得對應的文字系統與語言標記,讓 Word 正確排布中文、日文、韓文、阿拉伯文或希伯來文,在該由右往左的地方由右往左排,拼字檢查也會挑對語言。
大量心力花在那些不合常規的 PDF 上。橫向儲存的頁面會依它自己的閱讀方向解析,這樣頁面上的表格不會被轉置,標題也不會突然變成直排。從瀏覽器列印出來的 PDF,例如透過 Chrome 或 Edge 的「列印成 PDF」,會把清單的項目符號畫成極小的向量方塊而不是文字字元,還會把一整列表格黏成一行文字:這兩種情況都能依據幾何位置看穿,並重新拆回真正的清單與一個個儲存格。只有當頁碼在各頁之間確實繼續遞增時,它才會成為頁首或頁尾;一行只是看起來像頁碼的孤立文字會留在內文裡,而像「K-6」或「K-86」這類逐頁變化的頁面編號會被保留,而不是當成版面附屬物丟掉。
有兩件事本工具會講明,而不是替你隱瞞。如果來源 PDF 裡有文字位於不透明的黑條之下,卻依然能被當成文字讀出,也就是用畫上去的矩形假裝塗黑的經典錯誤,那麼這段文字不會進入 Word 檔,而且會告訴你它出現在哪幾頁。如果 PDF 中的字元根本沒有 Unicode 值,這也正是從任何 PDF 閱讀器複製都會失敗的原因,那麼它們所占的比例會被量化列出,並把你導向「PDF OCR」,而不是留下一段無聲的缺口。解析與檔案組裝完全在瀏覽器分頁裡完成:你的 PDF 不會離開你的裝置,首次載入之後本工具離線也能使用。
| 輸入格式 | |
|---|---|
| 自動轉換 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 輸出格式 | DOCX |
| 批次處理 | 不支援 |
| 處理方式 | 在瀏覽器中本機處理 (JavaScript) |
| 檔案上傳 | 無 |
限制: 這是結構化的轉寫,而不是對 PDF 的逐像素複製。會被轉入的內容:帶大綱階層的標題、段落、多層級的編號與項目符號清單、粗體、斜體、底線、刪除線、上標與下標、文字醒目提示(就近對應到 Word 的醒目提示色彩)、可點按的超連結、真正的註腳、閱讀順序中的圖片與向量繪製的圖表、帶有活動頁碼功能變數的真正頁首頁尾,以及取自真實幾何資料的頁面尺寸、方向、邊界與分欄數。表格依據框線、反覆出現的欄間空白或者「欄位: 值」形式的列來辨識;目前每一頁只評估一個連續的表格區域,因此同一頁上下疊放著數個各自加框的表格時,它們會刻意當成內文流過,而不是被錯誤地拼成一個表,巢狀很深或大量合併儲存格的表格也仍然是弱項。每個儲存格包含一個段落。其他據實說明的界線:一段連續排版的文字內部若有一處彩色文字,它會失去自己的色彩,而只覆蓋其中一部分的醒目提示會替整段上色;PDF 中沒有記錄目標位址的連結會被略過;註腳內文裡的連結不會維持可點按;巢狀在編號清單內部的項目符號清單會在該層級沿用編號記號(內容與階層正確,只有記號不同);如果頁首逐章變化,它會作為一般內文留在文件裡,而不會變成每章各自的頁首。圖文環繞、排版十分講究的頁面只能近似還原;線條或向量元素多達數千的頁面會略過表格與圖形辨識。掃描件或純圖片的 PDF 沒有文字層:這時會出現指向「PDF OCR」的提示,而不是一個空結果。受密碼保護的 PDF 請先用「解鎖 PDF」開啟。
不會。PDF 在瀏覽器分頁裡開啟,在那裡解析,Word 檔也在那裡組裝;根本不存在任何看得到這個檔案的伺服器。首次造訪之後,本工具即使在飛航模式下也照常運作,這就是沒有任何內容被上傳的最簡單證明。
不會,這是刻意的設計。PDF 是固定版面,Word 文件是流動的文字:逐點複製出來的東西在 Word 裡就無法有意義地編輯了。因此轉過來的是內容的意義:標題、段落、清單、表格、註腳、圖片、頁首頁尾,以及頁面尺寸與邊界。圖文環繞、排版十分講究的頁面只能近似還原。
會。排得更大、更粗的列會被辨識為 1 到 6 級標題,並取得相應的大綱階層。這樣一來不只是樣式可用,Word 的功能窗格與自動產生的目錄也立刻能用,你不需要自己再去調整格式。
會,只要 PDF 帶著它。來源 PDF 裡內嵌的字型檔會原封不動地轉入 Word 檔,一般、粗體、斜體與粗斜體四種字面各自獨立處理。只有當 PDF 裡缺少某款字型時,才會啟用一款字寬相容、採用開放授權的替代字型,它同樣會被嵌入,這樣文件在沒有安裝這些字型的電腦上也能正確顯示。
有可見框線的表格會成為真正的 Word 表格,欄寬來自實測的線條位置,單純的合併儲存格也完好保留。沒有框線但欄間空白明顯反覆出現的表格,以及「欄位: 值」形式的表單列,同樣會被辨識。目前每一頁只評估一個連續的表格區域:如果數個各自加框的表格上下疊放,它們會刻意當成內文流過,而不是被錯誤地拼成一個表。
可以。在 PDF 中以旋轉狀態儲存的頁面,會依它自己的閱讀方向解析,而不是依文件其餘部分的方向。因此這種頁面上的表格能維持列欄方向正確,標題也不會被誤當成直排文字。
能。列印成 PDF 時,Chrome 與 Edge 把清單的圓點畫成極小的向量方塊而不是文字字元,這讓純文字讀取看不到任何清單記號。本工具依據它們的大小以及它們對齊在同一欄上的事實把它們認出來,並連同各個階層一起還原整份清單。同樣來源下被黏在一起的表格列,也會重新拆成一個個儲存格。
三者都會。內嵌圖片會插入到閱讀順序中它原本的位置,寬度設有上限,比例維持不變;純以向量繪製的圖表同樣會被辨識為插圖。帶有記錄目標的連結會成為可點按的 Word 超連結,頁面下方的附註會成為真正的 Word 註腳。沒有目標位址的連結會被略過,註腳內文裡的連結不會維持可點按。
它不會進入 Word 檔。如果所謂的塗黑只是在文字上畫了一個黑色矩形,而沒有真正把文字刪掉,那麼這段文字在 PDF 內部依然完全可讀,這是一個常見且後果嚴重的錯誤。本工具會看穿完全位於不透明深色區塊之下的文字,把它排除在外,並告訴你這出現在哪幾頁上。
掃描件由圖片構成,沒有文字層。本工具會據實說明,並指向「PDF OCR」,而不是產生一個空的 Word 檔。如果檔案確實帶有文字,但其字元沒有記錄 Unicode 值,受影響的比例會被量化列出:這時從 PDF 閱讀器複製同樣會失敗,而回到文字的路徑就是 OCR。
DOCX 匯出 PDF · PDF轉EPUB · PDF轉Markdown文件 · PDF OCR 可搜尋轉換 · PDF 轉文字