PDF 是可读文本、扫描件、加密文件,还是混合文档?
如果文档受密码保护、主要是扫描页,或没有可靠文本层,先处理访问和 OCR;否则从结构检查与转换开始。
Elysia Tools
导航
Workflow Playbook
把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
专题
PDF 默认很少是干净的 LLM 输入。它可能包含扫描页、重复页眉、法律红线、隐藏图层、表格、图片说明,或者根本不该进入知识库的页面。这个工作流把这些问题放进同一条顺序里,让最终模型输入可审阅,而不是靠猜。
只有在获得授权时才使用 encrypted-pdf-converter 打开受保护文档,然后用 pdf-page-range-extractor 缩小处理范围。页码范围很重要,因为无关前言、附录和重复表单会污染嵌入结果,也会让引用变得不可信。对企业知识库来说,范围控制还可以减少敏感页面外泄和无关历史版本被错误召回的概率。
对扫描件或图片型文档,pdf-ocr-text-layer 和 scanned-pdf-ocr-to-markdown 可以把视觉页面转成可搜索文本。对数字 PDF,则先用 tagged-pdf-inspector 和 pdf-to-json-structure-explorer 检查语义,再通过结构化 Markdown、表格抽取和图片说明抽取保留可用内容。这样做能让后续分块知道段落、标题、表格和图像说明之间的关系,而不是把页面当作一串随机文本。
向向量库写入前,用 pdf-header-footer-noise-remover 去掉重复页面装饰,用 pdf-strikethrough-review-extractor 复核删除线残留,再用 pdf-prompt-injection-scanner 找出隐藏或页外文本。完成这些检查后,才适合用 pdf-to-clean-text-for-llm 做直接模型任务,或用 pdf-rag-chunker-citation-pack 生成可引用检索数据。合格的输出应让审核者追溯每个答案来自哪一页、哪个章节,以及哪些内容曾被清洗或标记为风险。
工作流指南
打开已获授权的密码保护文件,只抽取知识任务需要的页码,避免把无关附录、封面或表单噪声送进模型上下文。
为扫描 PDF 添加或确认 OCR 文本层;当原文件以图片为主或复制文本不可靠时,再导出带 OCR 依据的 Markdown。
比较 tagged PDF 结构与版面启发式结果,查看标题和节点元数据,并抽取 LLM 需要保留的 Markdown、表格和图片说明。
移除重复页眉页脚,检查可能仍具法律或审稿意义的删除线文本,并在信任抽取结果前扫描隐藏或页外内容。
为摘要类任务导出干净纯文本,或为检索系统生成按标题组织、带页码、边界框和引用元数据的分块包。
如果文档受密码保护、主要是扫描页,或没有可靠文本层,先处理访问和 OCR;否则从结构检查与转换开始。
摘要和改写通常只需要干净文本;RAG 入库则应保留页码、标题、表格、图片说明、边界框和安全检查结果。