# PDF 阅读顺序调试器

对比 PDF 原始绘制顺序与 XY-Cut++ 阅读顺序，定位多栏和复杂布局导致的抽取错乱

> 标准页面: https://elysiatools.com/zh/tools/pdf-reading-order-debugger

- **分类:** Developer Tools

- **关键词:** pdf, reading order, xycut

## 概述

上传 PDF 后，工具会分别以 `readingOrder=off` 和 `readingOrder=xycut` 运行 OpenDataLoader，并生成逐页对比报告。对于多栏论文、宣传册、财报和图文混排文档，这个报告可以帮助你判断是否必须启用布局感知阅读顺序。

## 输入项

- **PDF 文件** (file)
- **使用结构树** (checkbox)
- **包含页眉页脚** (checkbox)
- **页码范围** (text): e.g. 1,3,5-7

## 适用场景

- 处理多栏论文或报纸排版，发现文本提取顺序跨栏跳跃时。
- 财务报表或宣传册中存在大量图文混排，导致解析内容逻辑不连贯时。
- 需要评估是否在 OpenDataLoader 中启用 xycut 算法以优化 RAG 系统输入质量时。

## 工作原理

- 上传需要分析的 PDF 文件，并可选配置页码范围及是否包含页眉页脚。
- 系统分别以原始绘制顺序和 XY-Cut++ 算法运行解析引擎，提取文本流。
- 自动比对两种模式下的文本差异，识别因布局导致的顺序变更点。
- 生成交互式 HTML 报告，逐页展示对比结果并高亮显示解析顺序发生变化的区域。

## 使用案例

- 优化 RAG 知识库：确保多栏学术论文在向量化前按正确的逻辑顺序分块。
- 自动化报表解析：调试财报中表格与正文混排时的提取逻辑，防止数据错位。
- 电子书转换校验：在将复杂排版的 PDF 转换为 Markdown 前，验证阅读流的准确性。

## 常见问题

### 什么是 XY-Cut++ 算法？

这是一种基于递归投影切分的布局分析算法，能有效识别并按人类阅读习惯排列多栏文档的文本块。

### 为什么原始绘制顺序会出错？

PDF 内部对象的存储顺序往往取决于生成工具的写入逻辑，而非视觉上的阅读逻辑，导致多栏内容可能被横向串联。

### “使用结构树”选项有什么作用？

启用后将尝试利用 PDF 内部自带的 Tagged 标签信息来辅助确定阅读顺序，适用于规范生成的电子文档。

### 报告中显示“0 changed pages”代表什么？

这意味着在该页面上，XY-Cut++ 算法的解析结果与原始绘制顺序完全一致，布局相对简单。

### 该工具支持扫描件吗？

支持，但效果取决于 PDF 内部是否包含 OCR 文本层，工具主要针对文本层对象的排列顺序进行调试。

## 相关工具

- [公式 / 图表密集型 PDF 分析器](https://elysiatools.com/zh/tools/formula-chart-heavy-pdf-analyzer): 比较 OpenDataLoader 的本地与 hybrid 抽取结果，识别哪些 PDF 页面更适合使用 AI 辅助解析
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染
- [Tagged PDF 检查器](https://elysiatools.com/zh/tools/tagged-pdf-inspector): 对比启用和关闭 StructTree 的抽取结果，判断 PDF 是否具备可利用的 Tagged 语义结构
- [PDF 转 JSON 结构浏览器](https://elysiatools.com/zh/tools/pdf-to-json-structure-explorer): 提取 PDF 的 OpenDataLoader JSON 结构，并以浏览器视图查看标题、段落、表格、列表、页码和 bbox
- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF Prompt Injection 扫描器](https://elysiatools.com/zh/tools/pdf-prompt-injection-scanner): 通过对比安全抽取与关闭过滤后的抽取结果，识别 PDF 中的隐藏文本、页外内容、超小字体和隐藏图层风险
- [PDF转Markdown转换器](https://elysiatools.com/zh/tools/pdf-to-markdown): 将PDF文档转换为Markdown格式，支持文本提取和格式保留
- [PDF转文本增强版](https://elysiatools.com/zh/tools/pdf-to-text-advanced): 高级PDF转文本转换器，支持页码选择、格式选项和元数据提取

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [时区协作排期器 ICS 样本](https://elysiatools.com/zh/samples/time-zone-workflow-scheduler-ics-samples): 与 Time Zone Workflow Scheduler 返回结构一致的 ICS 文件样本，包含多个候选会议 VEVENT
- [OFD 样本](https://elysiatools.com/zh/samples/ofd-samples): 用于 GB/T 33190 版式文档解析与预览测试的 OFD 样本文件

## 相关内容

- [PDF 抽取与调试工作流](https://elysiatools.com/zh/hubs/pdf-extraction-debugging-workflows): 排查复杂 PDF 抽取失败：检查加密、安全风险、页范围、阅读顺序、OCR、表格、修订痕迹和结构化输出。
