结构,重建
标题层级、列表、块引用和代码都会以 Markdown 语法还原;双栏布局会按栏从上到下阅读,而不是横跨整页连续读取。
转换器比拼的是它们保留了什么。真正破坏 Markdown 的是在全部四百页上重复出现的页眉。
PDF 将字形存储在特定位置;你能看到的结构并未写在其中任何地方。重建这种结构、移除重复内容并处理表格,正是下面这三项功能所做的。
标题层级、列表、块引用和代码都会以 Markdown 语法还原;双栏布局会按栏从上到下阅读,而不是横跨整页连续读取。
页眉、页脚、页码、水印以及每页上的保密声明都会被移除——包括跨分页而用连字符断开的单词。你会得到一份已移除内容的清单。
表格会以 Markdown 表格的形式还原;跨页断开的表格会被合并起来,而不是重新开始。当合并单元格无法干净映射时,会明确说明,而不是猜测。
只需三步,即可从 PDF 得到可直接放入管道的 Markdown。
可以是单个文件,也可以是一个包含多个文件的文件夹。结果是由人还是由模型阅读,会改变哪些内容值得保留,因此有必要说明用途。
它会根据文档的排版方式推断标题层级、排序列顺序、映射表格,并去除每一页上重复出现的内容。
在 Markdown 被用到任何地方之前,先检查移除内容的清单。将这次运行保存为 Playbook,这样来自同一来源的下一批文件就会以相同方式处理。
保留一切很容易。真正的工作是决定什么不应在转换过程中活下来。
PDF 中不存储标题级别,也不存储段落——只有按特定字号放置在坐标上的字符。每个转换器都在根据字号和间距推断结构,这也是为什么两款转换器会从同一文件生成不同 Markdown 的原因。
.jpeg&w=1920&q=75)
这类工具比拼的是保真——保留表格、保留页眉。但每隔五百字就出现一次的页码和保密横幅,虽然被忠实保留,却反而有害,因为接下来无论什么读取这份文档,都必须在每个分块中跨过它们。移除值得被当作一项功能。
.jpeg&w=1920&q=75)
在管道中,Markdown 是一种中间产物——被生成、被嵌入,从未被人打开。因此当答案出错时,模型会被指责,而转换环节却永远不会被指责。这就是为什么这一步应告诉你它做了什么,而不是交给你一份看起来很干净的东西。
.jpeg&w=1920&q=75)
构建检索管道的团队、把文档整理到笔记中的人、将 PDF 纳入版本控制的文档团队,以及长期档案管理者。
分块器并不知道它刚刚切分的那一行是页脚,于是页脚最终出现在一个本来在讲其他内容的分块中。这个现象乘以语料库中的每一页,检索质量就会悄然变差,而原因却没人追溯到导入环节。
放在文件夹中的 PDF 并不真正属于你的笔记——它无法被链接、无法被内联引用,也无法被你实际使用的搜索找到。转换它,才能让它成为你文档中的一份文档,而不是一个附件。
以 PDF 形式交付的规范说明位于文档系统之外:单独的搜索、单独的历史记录、单独查看的位置。将其纳入系统,意味着它和其他所有内容一起被维护,而不是沦为人们忘记其存在的文件。
PDF 现在可读,却永远难以使用——难以跨文件搜索、难以重新排版,并且受制于生成它的工具。保留结构的纯文本,才是原始工具消失后仍然有用的版本。
探索更多覆盖研究、内容和数据的 AI 驱动工具。
表格、扫描件、费用,以及所有重复内容的处理方式。
它将 PDF 转换成携带其结构的纯文本——标题用井号表示、列表用项目符号表示、表格用竖线分隔的行表示。它比以前更重要,因为语言模型和搜索索引能很好地阅读 Markdown,却很难阅读 PDF,所以这种转换如今已成为许多管道的第一步,而非偶尔的便利操作。
是的,一次免费处理一个文件。付费方案面向那些重复出现的情况:一次处理整个文件夹、文档模板带有需要识别的页面装饰,以及保持处理方式一致,让第四百个文件与第一个文件看起来相同。
简单表格能干净地映射到 Markdown。合并单元格和嵌套表头在 Markdown 中根本没有对应物,因此必须有所取舍——它们不会被悄悄压平,而是会被明确标注出来,这样你就可以决定该表格是保留为图片,还是手动重构。
目前不能。扫描页是文字的图像,而不是文字本身,读取图像并非这个工具当前能做的事。有个快速测试:打开 PDF,尝试用光标选中一个句子。如果能选中,转换也能成功;如果没有任何内容被高亮选中,就无法转换。
大多数工具转换完就结束;当你只有一个文件时,这正是合适的形态。而本工具是为同一来源的四百个文件而构建:该模板中哪些算页面装饰,只需识别一次即可应用到其余文件,而且你会被告知移除了什么,无需轻信那份干净输出是完整的。