# PDF 转 JSON 结构浏览器

提取 PDF 的 OpenDataLoader JSON 结构，并以浏览器视图查看标题、段落、表格、列表、页码和 bbox

> 标准页面: https://elysiatools.com/zh/tools/pdf-to-json-structure-explorer

- **分类:** Developer Tools

- **关键词:** pdf, json, structure, explorer

## 概述

上传 PDF 后，工具会生成 OpenDataLoader JSON，然后把识别到的标题、段落、列表、表格与页码、bounding box 一起渲染成结构浏览报告。适合调试解析质量、核对表格识别以及查看文档的语义层。

## 输入项

- **PDF 文件** (file)
- **使用结构树** (checkbox)
- **脱敏敏感数据** (checkbox)
- **页码范围** (text): e.g. 1,3,5-7
- **节点类型过滤** (select)
- **搜索词** (text): e.g. revenue or heading

## 适用场景

- 需要调试 PDF 解析器质量，验证标题层级和段落划分是否准确时。
- 提取复杂 PDF 表格数据前，需要预览和核对表格结构及边界框（BBox）信息时。
- 开发基于大语言模型（LLM）的文档问答系统前，需要清洗和检视底层语义节点时。

## 工作原理

- 上传需要解析的 PDF 文件，并可选择性地指定需要处理的页码范围（如 1,3,5-7）。
- 配置解析选项，例如是否使用结构树、是否脱敏敏感数据，以及按节点类型（如仅表格、仅标题）进行过滤。
- 工具在后台运行 OpenDataLoader 引擎，提取文档的语义节点并生成结构化的 JSON 数据。
- 最终输出一个可视化的 HTML 浏览报告，直观展示所有提取的节点、页码、边界框及内容。

## 使用案例

- 开发者调试文档解析算法，对比不同 PDF 文件的结构树提取效果。
- 数据工程师在构建 RAG（检索增强生成）知识库前，预览和清洗 PDF 的语义分块（Chunking）质量。
- 业务人员快速检索长篇研究报告或品牌指南中的特定表格和列表数据。

## 常见问题

### 这个工具支持哪些节点类型的过滤？

支持过滤显示全部节点，或者仅显示标题（heading）、表格（table）和列表（list）节点，方便您快速定位特定结构。

### 如何只解析 PDF 的部分页面？

您可以在“页码范围”输入框中指定需要解析的页面，例如输入“1-5,8”即可仅提取这些页面的结构数据。

### 什么是边界框（Bounding Box）？

边界框（BBox）是记录文本或表格在 PDF 页面上具体物理位置的坐标数据，有助于进行精准的版面分析和内容定位。

### “脱敏敏感数据”功能有什么作用？

开启该功能后，工具会在解析过程中自动识别并遮蔽常见的敏感信息，保护数据隐私。

### 导出的结果是什么格式？

工具会直接在浏览器中生成一份交互式的 HTML 报告，您可以在其中直观地浏览 JSON 结构和语义节点。

## 相关工具

- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF 注释导出](https://elysiatools.com/zh/tools/pdf-annotation-export): 将 PDF 中已有的注释（高亮、批注、印章、链接、标记）导出为 JSON 字符串
- [PDF 表单数据导出](https://elysiatools.com/zh/tools/pdf-form-data-export): 读取 PDF AcroForm 字段的名称、类型和当前值，并导出为 JSON 字符串
- [PDF 表格提取到 CSV/JSON](https://elysiatools.com/zh/tools/pdf-table-extractor-to-csv-json): 用 OpenDataLoader 从 PDF 中抽取表格，并导出为结构化 JSON、扁平 CSV 或 HTML 表格
- [加密 PDF 转换器](https://elysiatools.com/zh/tools/encrypted-pdf-converter): 输入正确密码后解析受保护 PDF，并导出为 Markdown、JSON 或文本
- [PDF 页码范围提取器](https://elysiatools.com/zh/tools/pdf-page-range-extractor): 按指定页码范围提取 PDF 内容，并导出为 Markdown、JSON 或纯文本
- [健身训练 PDF 生成器](https://elysiatools.com/zh/tools/fitness-workout-pdf-generator): 从 JSON 或 CSV 训练计划数据生成可打印 PDF，包含动作表格、进度格子和可选的视频二维码
- [LibreOffice 模板填充合并](https://elysiatools.com/zh/tools/libreoffice-template-fill-merge): DOCX模板占位符替换并渲染为PDF（邮件合并风格）

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Terraform Plan JSON 样本](https://elysiatools.com/zh/samples/terraform-plan-json-samples): 用于依赖可视化和变更审查的 Terraform plan JSON 文件样本，贴近 terraform show -json 输出结构
- [JSON 示例](https://elysiatools.com/zh/samples/json): JSON（JavaScript 对象表示法）格式示例，从简单到复杂结构
- [聊天记录 JSON 示例](https://elysiatools.com/zh/samples/chat-transcript-json): 多角色聊天记录的 JSON 示例

## 相关内容

- [文档 OCR 提取](https://elysiatools.com/zh/hubs/document-ocr-extraction): 从扫描件提取 OCR 文本，并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果，同时检查抽取质量。
- [PDF 转换、OCR 与内容提取工作流](https://elysiatools.com/zh/hubs/pdf-convert): 将办公文档、Wiki 页面、注释和图片转成 PDF，再从现有 PDF 中提取文本、图片、表格、结构或 OCR 文本层。
- [PDF 抽取与调试工作流](https://elysiatools.com/zh/hubs/pdf-extraction-debugging-workflows): 排查复杂 PDF 抽取失败：检查加密、安全风险、页范围、阅读顺序、OCR、表格、修订痕迹和结构化输出。
- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
