PDF转Markdown
Markdown留阅读顺序和简单结构,不留页面版式。所以只问一件事: 你的PDF装的是真字还是字的照片。能选中的字直接转,扫描件先识别,表格公式事后都要验。
真字还是扫描:一招定
随便哪个阅读器打开,拖过一段。字逐行高亮,文件带文字层,下面所有办法直接上; 整页一块选中或什么都选不中,这页是图,识别没猜出字母之前没东西可提。
这个分法贯穿全市场。浏览器里转的把这两件当两个活:一个模式读文字层,一个模式给扫描件跑识别。 本站本地工具只干第一件,扫描件拒收不交空文件,这是同一个分法的实在版。
本地路线:浏览器里转原生文字
PDF转Markdown工具读原生文字层,按阅读顺序重排, 看字号字体认简单标题列表代码块。页标记按需留成Markdown注释,认得准的重复页眉页脚能去掉。
不上传,转换全在标签页里。产出的Markdown重读回来和留下的字对照,留存验不过不给下载。 纯图扫描件直接拒,因为识别是另一件活:猜出来的字要自己的准确率和人工复核。
一两页复制粘贴
短段落,选中拷到笔记或AI工具里,胜过任何转换器。不装不传,活下来多少一眼看见。
页数一多就崩。多栏页粘出来顺序错,连字符断词留着,标题变成没结构的素行。引一句行,转整篇不行。 几页以上别跟剪贴板较劲,上提取。
命令行批量老路
文件多、活重复,标准管线从Poppler起:pdftotext把文字层抽成纯文本,Pandoc在文本格式之间倒成Markdown。
这条管线不办的事说清:它提看得见的字符,不从定位的PDF字里猜文档结构。 标题列表表格出来是平的,手重建或加工具。它适合脚本批量提,结构要紧又没人复核就不适合。
扫描页先识别再转Markdown
识别从像素猜字母,所有转扫描件的Markdown转换器都是识别打底加排版。 识别这步出名的开放工具是Tesseract和OCRmyPDF,好几家在线转换器把它做成独立模式,不和纯提取掺着卖。
复核时间留足,猜就有错。小字怪字体表格公式先坏,错得自信,Markdown里和页上一样自信。 引用出版用的扫描转换,字要人过一遍,光转不够。
排名靠前的转换器给什么
上传派里CloudConvert在服务器上把PDF转Markdown,标题列表结构能保则保。 iLovePDF在PDF Intelligence下挂PDF转Markdown,号称标题表格列表链接全留。当前头部里的浏览器本地派是craftmarkdown和JustMarkdown, 反着承诺:不上传没服务器。中间形态pdf2go,自称浏览器转换带标题列表识别,不宣传扫描识别模式。 那些是它们页面的说法,不是本站测出来的,上传路线都在别人服务器上画你的页。2026年9月看的页。
本指南本地条件故意收窄:原生文字,不识别,不上传,页标记当Markdown注释,认得准的重复才去,留存验过才有得下。 拒收扫描件不是缺功能,猜开始的地方就是线。
每次转换都坏的东西
PDF记的是页上位置的字,Markdown记的是阅读顺序加一小套结构,有些东西永远过不来。 复杂表格压平或错位,数学公式丢符号,多栏顺错列,脚注和标记分家,图过去了意思过不来——没有替代文本装它。
计划验,不只计划转。短文档拿Markdown贴着PDF逐页扫,长的抽表格图首尾页。 要紧的表格单独提,别指望在Markdown导出里蒙混过关。
常见问题
- 我的PDF要不要先识别?
- 随便哪个阅读器拖一段。逐行高亮带文字层,直接转;整页一块或选不中是扫描件,先识别再谈Markdown。
- 表格转得过去吗?
- 简单格子常行,复杂的多半压平错位。要紧的表单独走PDF转CSV,别在Markdown导出里碰运气。
- 本地转换传文件吗?
- 不传。打开转换校验预览全在浏览器标签页里,机密研究内部报告正合适。
- 页标记长什么样?
- 每页开头一条Markdown注释比如Page 3。渲染时不显示,只留分页;不要连贯长文就全去掉。
- Markdown能转回PDF吗?
- 能。Markdown转PDF画成带可选文字页码版式的核验PDF。
- 怎么几乎没提出字?
- 八成是扫描件:纯图页没有文字层可提。先识别再转识别结果,猜出来的字带着自信的错,要复核。
现在就做
工具在本浏览器里跑。文件从不出本机, 结果先验再下载。
PDF转Markdown接下来去哪里
- PDF转Markdown 把带可选文字的PDF变成验过的Markdown。
- Markdown转PDF 把Markdown画回排好版验过的PDF。
- PDF转CSV 把表格从PDF里抠成表格行。
- 编辑PDF 找到适合你的PDF修改指南。