PDFをWordに
PDFをローカルで編集可能なWord文書(DOCX)に変換します。見出し、リスト、太字/斜体、表、画像も含まれます。アップロードなし。
お使いの端末でローカル処理中 ...
ファイル
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
私のファイルはアップロードされますか?
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
PDFをローカルで編集可能なWord文書(DOCX)に変換します。見出し、リスト、太字/斜体、表、画像も含まれます。アップロードなし。
お使いの端末でローカル処理中 ...
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
PDFは完成したレイアウトであって、編集できるテキストではありません。段落は選びにくく、文章はきれいに書き直せず、表の計算を続けることもできません。このツールはPDFの実際の構造、つまり見出し、段落、リスト、表、脚注、画像を読み取り、そこから端末上でOffice Open XML形式の本物のDOCXファイルを組み立てます。できあがったファイルはWord、LibreOffice Writer、あるいは.docxを理解するどのソフトでもそのまま開けます。透かしもアカウントも1日あたりの上限もありません。変換はサーバーではなくブラウザーのタブの中で行われるからです。
段落と文字の水準では、太字と斜体だけにとどまらず、はるかに多くが残ります。見出しはレベル1から6までの本物のWord見出しになり、アウトラインレベルも付くため、ナビゲーションウィンドウと自動作成の目次がすぐに機能します。入れ子の箇条書きは、その階層を本物の多階層リストとして保ちます。下線と取り消し線はページに実際に引かれた線から、上付き文字と下付き文字はずれたベースラインから判別され、色付きの蛍光ペンによる強調はWord形式が扱える16色の中で最も近い色に割り当てられます。PDF内のリンクはクリックできるWordのハイパーリンクになり、ページ下部の注記はページ末尾に浮いたテキストではなく、脚注機能に収まる本物のWord脚注になります。
表は三つの異なる経路で検出されます。第一に実際に引かれた罫線からで、この場合の列幅は測定した罫線の位置に由来し、単純な結合セルは結合されたままになります。第二に、罫線がまったくない表では列と列のあいだにはっきり繰り返される余白から。第三に、フォームのPDFが生み出す「項目: 値」という形の行が3行以上連続する並びからです。用紙サイズ、縦置きか横置きか、余白、本文の段数は、A4という決めつけではなくページの実際の座標から取り込まれ、元のページの境目ごとにきれいな改ページが入り、画像は縦横比を保ったまま読み順の中の本来の位置に埋め込まれます。ベクトルだけで描かれたグラフも図として認識されます。繰り返し現れるヘッダーとフッターは、左寄せ、中央、右寄せのタブ位置を備えた本物のWordのヘッダーとフッターになり、通し番号のページ番号は固定された数字ではなく生きたWordのフィールドになります。繰り返される透かしも一緒に引き継がれます。
フォントについて、このツールは遠回りをしません。元のPDFに埋め込まれたフォントプログラムそのものを、標準、太字、斜体、太字斜体のそれぞれについて別々に、加工せずWordファイルへ移します。そのため太字の段落には、ワープロが後から計算した太らせではなく、書体設計そのものの輪郭が入ります。PDFがフォントをまったく持っていない場合にのみ、文字幅の互換性があるオープンライセンスの代替書体が入り、それも同じくファイルに埋め込まれます。ですから、その書体が入っていない他人のパソコンでも文書は正しく表示されます。ラテン文字以外のテキストにはさらに適切な文字体系と言語の指定が付くため、Wordは中国語、日本語、韓国語、アラビア語、ヘブライ語を正しく整形し、必要な箇所では右から左へ組み、スペルチェックも正しい言語を選びます。
手間の多くは、標準から外れたPDFに費やされています。横向きに保存されたページはそのページ自身の読み方向で解析されるため、そこにある表が転置されて届くことも、見出しが突然縦組み扱いになることもありません。ブラウザーから印刷したPDF、たとえばChromeやEdgeの「PDFに保存」で作られたものは、箇条書きの点を文字ではなくごく小さなベクトルの四角として描き、表の1行まるごとを一本のテキスト行に貼り合わせてしまいます。どちらも図形の配置から見抜かれ、本物のリストと個々のセルに戻されます。ページ番号がヘッダーやフッターになるのは、ページをまたいで実際に数が進んでいる場合だけです。ページ番号に見えるだけの一度きりの行は本文に残り、「K-6」や「K-86」のように変化するページ記号も、飾りとして捨てられずに保持されます。
このツールが黙って済ませず、はっきり伝えることが二つあります。元のPDFで文字が不透明な黒い帯の裏にありながら、なおテキストとして読み取れる状態だった場合、つまり長方形を上から塗って黒塗りしたつもりになる古典的な失敗があった場合、その文字はWordファイルに引き継がれず、どのページで起きたかが知らされます。またPDF内の文字にUnicodeの値がまったく割り当てられていない場合、これはどのPDFビューアーからのコピーも失敗する状態ですが、その割合が数値で示され、黙って欠落を残す代わりに「PDF OCR」が案内されます。解析とファイルの組み立てはすべてブラウザーのタブの中で完結します。PDFが端末から出ることはなく、一度読み込んだ後はオフラインでも使えます。
| 入力形式 | |
|---|---|
| 自動変換 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 出力形式 | DOCX |
| 一括処理 | 非対応 |
| 処理 | ブラウザ内でローカル処理 (JavaScript) |
| ファイルのアップロード | なし |
制限: 構造を移し替える変換であり、PDFをピクセル単位で複製するものではありません。引き継がれるもの: アウトラインレベル付きの見出し、段落、多階層の番号付きリストと箇条書き、太字、斜体、下線、取り消し線、上付きと下付き、文字の強調表示(Wordの蛍光色に丸められます)、クリックできるハイパーリンク、本物の脚注、読み順に沿った画像とベクトルで描かれたグラフ、生きたページ番号フィールドを備えた本物のヘッダーとフッター、さらに実際の座標から取り込んだ用紙サイズ、向き、余白、段数。表は罫線、繰り返される列の余白、または「項目: 値」形式の行から検出されます。ただし現時点では1ページにつき連続した表領域を一つだけ評価するため、別々に枠で囲まれた表が同じページに縦に並んでいる場合は、誤って一つに組み立てるよりも本文として流すことを選びます。入れ子が深い表や結合が多い表も苦手なままです。各セルは1段落です。ほかにも正直な限界があります。連続して組まれた一続きの文字列の中にある色付き部分は自前の色を失い、その一部だけを覆う強調表示は全体を塗ります。PDFに宛先が記録されていないリンクは飛ばされます。脚注本文の中のリンクはクリックできません。番号付きリストの中に入れ子になった箇条書きは、その階層で番号の記号を受け継ぎます(内容と階層は正しく、記号だけが異なります)。章ごとにヘッダーが変わる場合、それは章ごとの独立したヘッダーにはならず、通常の本文として残ります。図の周りに文字を回り込ませた凝ったページは近似となり、線やベクトル要素が数千に及ぶページでは表と図の検出を省きます。スキャンした、あるいは画像だけのPDFにはテキスト層がないため、空の結果を返す代わりに「PDF OCR」への案内が表示されます。パスワード保護されたPDFは先に「PDFのロック解除」で開いてください。
いいえ。PDFはブラウザーのタブの中で開かれ、そこで解析され、Wordファイルもそこで組み立てられます。ファイルを目にするサーバーは存在しません。一度アクセスした後は機内モードでも動作し続けます。これが、何もアップロードされていないことの最も単純な証拠です。
いいえ。そしてそれは意図した設計です。PDFは固定されたレイアウト、Word文書は流れるテキストであり、点単位の複製ではWordで意味のある編集ができなくなります。そこで引き継がれるのは意味の側です。見出し、段落、リスト、表、脚注、画像、ヘッダーとフッター、さらに用紙サイズと余白。図の周りに文字を回り込ませた凝ったページは近似となります。
はい。大きく太く組まれた行はレベル1から6の見出しとして判別され、対応するアウトラインレベルが与えられます。そのためスタイルだけでなく、Wordのナビゲーションウィンドウと自動生成される目次もすぐに機能し、あなたが手作業で書式を直す必要はありません。
はい、PDFがフォントを持っている場合は保たれます。元のPDFに埋め込まれたフォントファイルを、標準、太字、斜体、太字斜体それぞれ別々に、加工せずWordファイルへ移します。PDFにフォントが欠けている場合にのみ、文字幅の互換性があるオープンライセンスの代替書体が入り、それも埋め込まれます。ですからその書体が入っていないパソコンでも文書は正しく表示されます。
罫線が見えている表は本物のWordの表になり、列幅は測定した罫線の位置から決まり、単純な結合セルもそのまま残ります。罫線がなくても列の余白がはっきり繰り返される表や、「項目: 値」という形のフォーム行も検出されます。現時点では1ページにつき連続した表領域を一つだけ評価します。別々に枠で囲まれた表が縦に並んでいる場合は、誤って組み立てるよりも本文として流します。
はい。PDF内で回転して保存されたページは、文書のほかの部分ではなく、そのページ自身の読み方向で解析されます。そのためそのページにある表は行と列の向きを正しく保ち、見出しが誤って縦組みの文字として扱われることもありません。
はい。PDFに印刷するとき、ChromeとEdgeはリストの点を文字ではなくごく小さなベクトルの四角として描くため、純粋なテキスト読み取りでは箇条書きの印が見えません。このツールは大きさと、同じ列にそろって並んでいることから点を見抜き、階層も含めてリストを復元します。同じ出所の、貼り合わされた表の行も個々のセルに戻されます。
はい、三つとも引き継がれます。埋め込み画像は読み順の中の本来の位置に、幅の上限を設けつつ縦横比を保って挿入されます。ベクトルだけで描かれたグラフも図として認識されます。宛先が記録されたリンクはクリックできるWordのハイパーリンクになり、ページ下部の注記は本物のWord脚注になります。宛先のないリンクは飛ばされ、脚注本文の中のリンクはクリックできません。
Wordファイルには引き継がれません。黒塗りが、文字を本当に削除するのではなく上から黒い長方形を塗る形で行われていた場合、その文字はPDFの中で完全に読み取れる状態のまま残ります。これはよくある、そして影響の大きい失敗です。このツールは不透明な暗い面の背後に完全に隠れた文字を見抜いて除外し、どのページで起きたかを知らせます。
スキャンは画像でできており、テキスト層がありません。このツールはそれを正直に伝え、空のWordファイルを作る代わりに「PDF OCR」を案内します。テキストは入っていても文字にUnicodeの値が記録されていない場合は、該当する割合が数値で示されます。その状態ではPDFビューアーからのコピーも失敗し、テキストに戻る道はOCRです。
DOCX PDF変換 · PDFをEPUBに · PDFをMarkdownに変換 · PDF OCR 検索可能化 · PDFをテキストに