# PDF 删除线审阅提取器

检测 PDF 审阅稿中的删除线内容，并生成适合合同、制度和修订稿分析的报告

> 标准页面: https://elysiatools.com/zh/tools/pdf-strikethrough-review-extractor

- **分类:** Developer Tools

- **关键词:** pdf, strikethrough, review

## 概述

上传 PDF 后，工具会开启 OpenDataLoader 的删除线检测，并从 JSON 与 Markdown 输出中提取被删除或被审阅标记的文本，帮助你快速核查修订差异。

## 输入项

- **PDF 文件** (file)
- **页码范围** (text): e.g. 1,3,5-7
- **使用结构树** (checkbox)

## 适用场景

- 需要核对法律合同中被对方删除的特定条款时
- 审计公司内部规章制度的修订版本，确认哪些旧规定已被废除
- 在多轮编辑审阅过程中，快速汇总所有被标记为删除的文本内容

## 工作原理

- 上传需要分析的 PDF 审阅稿文件，并根据需要指定页码范围
- 系统调用 OpenDataLoader 引擎，扫描文档中的图形层和文本层以识别删除线标记
- 提取被删除线覆盖的文本内容，并结合文档结构树保持上下文关联
- 生成一份直观的 HTML 报告，清晰展示所有被删除的文本及其在原文档中的位置

## 使用案例

- 法律合规审查：快速提取合同修订稿中被剔除的免责条款或违约责任说明
- 政策文件比对：在制度更新时，自动汇总旧版文件中不再适用的条文
- 出版校对：编辑可以一键导出审阅者在样稿中划掉的所有冗余文字，方便后续修改

## 常见问题

### 该工具支持哪些文件格式？

目前仅支持 PDF 格式的文档。

### 如何只处理文档中的特定几页？

您可以在“页码范围”选项中输入具体的页码（如 1, 3）或范围（如 5-7）。

### “使用结构树”选项有什么作用？

开启后，工具会尝试根据 PDF 的内部结构（如标题、段落）来组织提取的内容，使报告更具可读性。

### 提取的结果以什么形式展示？

工具会生成一个 HTML 页面，列出所有检测到的删除线文本及其对应的审阅上下文。

### 它能识别手写的删除线吗？

该工具主要针对电子文档中通过 PDF 编辑软件添加的标准删除线标记进行检测。

## 相关工具

- [无障碍审计报告生成器](https://elysiatools.com/zh/tools/accessibility-audit-report-generator): 检查 HTML 或 URL 中的常见 WCAG 问题，并导出按严重程度分组的 PDF 报告
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染
- [Tagged PDF 检查器](https://elysiatools.com/zh/tools/tagged-pdf-inspector): 对比启用和关闭 StructTree 的抽取结果，判断 PDF 是否具备可利用的 Tagged 语义结构
- [PDF 页码范围提取器](https://elysiatools.com/zh/tools/pdf-page-range-extractor): 按指定页码范围提取 PDF 内容，并导出为 Markdown、JSON 或纯文本
- [公式 / 图表密集型 PDF 分析器](https://elysiatools.com/zh/tools/formula-chart-heavy-pdf-analyzer): 比较 OpenDataLoader 的本地与 hybrid 抽取结果，识别哪些 PDF 页面更适合使用 AI 辅助解析
- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF 图片与 Caption 提取器](https://elysiatools.com/zh/tools/pdf-image-caption-extractor): 提取 PDF 图片、匹配附近 caption，并生成可浏览的 HTML 图文索引
- [PDF 逻辑结构树 WCAG 角色映射验证器](https://elysiatools.com/zh/tools/pdf-logical-structure-tree-validator): 审计 PDF/UA-1 逻辑结构树：RoleMap 是否映射到标准结构类型、H1–H6 标题层级是否跳级或首个标题非 H1、Figure/Formula 是否缺失 Alt 替代文本、语言标签继承链是否可判定、结构与内容流 MCID 阅读顺序是否分歧，并输出带 Matterhorn 检查点编号的结构大纲。

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [变更日志提取器样本](https://elysiatools.com/zh/samples/changelog-extractor): 用于测试变更日志解析和提取工具的各种变更日志格式
- [手机号提取器示例](https://elysiatools.com/zh/samples/phone-number-extractor): 包含来自多个国家的电话号码的混合文本集合，用于提取测试

## 相关内容

- [PDF 抽取与调试工作流](https://elysiatools.com/zh/hubs/pdf-extraction-debugging-workflows): 排查复杂 PDF 抽取失败：检查加密、安全风险、页范围、阅读顺序、OCR、表格、修订痕迹和结构化输出。
- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
