PDF 转 Markdown
在浏览器本地将 PDF 文本层转换为 Markdown,自动识别标题、列表和段落结构。无需上传文件。
正在你的设备上本地处理 ...
你的文件
正在你的设备上本地处理 ...
0%
我的文件会被上传吗?
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
在浏览器本地将 PDF 文本层转换为 Markdown,自动识别标题、列表和段落结构。无需上传文件。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
Markdown 是笔记、Wiki、静态网站和 AI 工具的通用格式:简洁、易于版本管理、随处可读。以往若想在这些场景中复用 PDF 内容,只能费力地手动复制。此工具读取 PDF 的文本层,并以已具备基本结构的 Markdown 返回,包含标题、项目列表和段落,而非一整面文字墙。
结构检测采用启发式算法:比正文字号明显更大的行会转换为标题(#、## 或 ###),以项目符号或数字开头的行会转换为 Markdown 列表,行与行之间较大的垂直间距则标志着新段落的开始。由此,从纯粹的文本位置信息中生成一份可读、可复用的 Markdown 文档,是你在编辑器中进一步打磨的理想起点。
坦诚说明:这是结构近似,并非忠实的版面重建。表格、多列页面和精细格式无法从文本层无损还原。与纯文本提取一样,扫描件或纯图片 PDF 没有文本层,结果将为空,此时请改用 PDF OCR。所有处理通过 pdf.js 在浏览器本地运行,文件不会离开你的设备。
| 输入格式 | |
|---|---|
| 自动转换 | PNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP |
| 输出格式 | MD |
| 批量处理 | 不支持 |
| 处理方式 | 在浏览器中本地处理 (JavaScript) |
| 文件上传 | 无 |
限制: 将 PDF 现有文本层转换为 Markdown(UTF-8 .md)。标题、列表和段落通过字号和间距启发式识别,属于结构近似,并非精确版面重建。表格和多列页面仅作线性近似。扫描件或纯图片 PDF 没有文本层,结果将为空,请改用 PDF OCR。密码保护的 PDF 请先解除保护。只读取文本内容(pdf.js 的 getTextContent),嵌入的图片不会带入 Markdown。
依据字号判断:比正文明显更大的行,根据大小比例转换为 #、## 或 ###。
不能。转换属于结构近似,表格和多列版面仅作线性近似,并非原样重建。
你的 PDF 可能是扫描件或由图片构成,没有文本层。请改用 PDF OCR,它能从像素中识别文字。
不会。转换完全在浏览器本地通过 pdf.js 运行,文件不会离开你的设备。
PDF 转文本 · PDF OCR 可搜索化 · HTML 转 Markdown · Markdown 转 PDF · 提取PDF表格 · PDF转Word