# PDF 表格提取到 CSV/JSON

用 OpenDataLoader 从 PDF 中抽取表格，并导出为结构化 JSON、扁平 CSV 或 HTML 表格

> 标准页面: https://elysiatools.com/zh/tools/pdf-table-extractor-to-csv-json

- **分类:** Data Processing

- **关键词:** pdf, table, csv, json

## 概述

上传 PDF 后，工具会先通过 OpenDataLoader 识别语义表格节点，再按你选择的格式导出。JSON 会保留页码、bbox、行列数量和完整单元格内容；CSV 会拉平成 table/page/row/column/value；HTML 会生成逐表格的可视化预览。

## 输入项

- **PDF 文件** (file)
- **导出格式** (select)
- **表格检测方式** (select)
- **页码范围** (text): e.g. 1,3,5-7
- **使用结构树** (checkbox)

## 适用场景

- 需要从财务年报或商业报告中批量提取数据表格进行二次分析时。
- 开发人员需要将 PDF 格式的科研论文或技术文档中的表格解析为结构化 JSON 数据时。
- 需要将 PDF 账单、发票或统计报表中的表格转换为 CSV 格式以便在 Excel 中处理时。

## 工作原理

- 上传需要提取表格的 PDF 文件，并可选择性地输入需要处理的特定页码范围（如 1,3,5-7）。
- 选择目标导出格式（JSON、CSV 或 HTML），并根据表格复杂度选择默认或聚类增强的检测方式。
- 工具底层调用 OpenDataLoader 引擎，自动识别 PDF 中的语义表格节点并解析行列结构。
- 处理完成后，直接下载提取好的结构化数据文件，JSON 格式会保留完整的页码、坐标及单元格内容。

## 使用案例

- 财务分析师从数百页的 PDF 审计报告中快速提取利润表和资产负债表数据至 CSV。
- 数据工程师批量解析行业白皮书 PDF，将统计表格转换为 JSON 格式存入数据库。
- 研究人员将学术文献中的实验结果表格提取为 HTML 格式，方便直接嵌入到网页或笔记中。

## 常见问题

### 支持导出哪些格式？

支持导出为结构化 JSON、扁平化 CSV 以及可视化的 HTML 表格。

### 什么是“聚类增强”检测方式？

聚类增强（Cluster）是一种更高级的表格检测算法，适合处理无边框或排版复杂的表格，能有效提高行列识别的准确率。

### 可以只提取 PDF 中某几页的表格吗？

可以，在“页码范围”输入框中指定需要提取的页码即可，例如输入“1,3,5-7”将只处理这些特定页。

### 导出的 JSON 包含哪些信息？

导出的 JSON 数据不仅包含单元格的文本内容，还会保留表格所在的页码、边界框坐标（bbox）以及行列数量等结构化信息。

### 为什么有些表格提取出来行列错乱？

可能是因为 PDF 扫描质量差或表格排版过于特殊。建议尝试勾选“使用结构树”或将检测方式切换为“聚类增强”来改善提取效果。

## 相关工具

- [健身训练 PDF 生成器](https://elysiatools.com/zh/tools/fitness-workout-pdf-generator): 从 JSON 或 CSV 训练计划数据生成可打印 PDF，包含动作表格、进度格子和可选的视频二维码
- [PDF发票生成器](https://elysiatools.com/zh/tools/pdf-invoice-generator): 使用结构化明细生成带品牌的发票PDF
- [Data URI 生成器](https://elysiatools.com/zh/tools/data-uri-generator): 将文件转换为 Data URI（Base64 或百分号编码），用于直接在 HTML、CSS 或 Markdown 中内联图片、字体等资源
- [CSV / Excel 差异比对工具](https://elysiatools.com/zh/tools/csv-excel-diff-tool): 比较两个 CSV 或 XLSX 数据源，导出包含行级、列级和单元格差异的 PDF 报告
- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF 注释导出](https://elysiatools.com/zh/tools/pdf-annotation-export): 将 PDF 中已有的注释（高亮、批注、印章、链接、标记）导出为 JSON 字符串
- [PDF 表单数据导出](https://elysiatools.com/zh/tools/pdf-form-data-export): 读取 PDF AcroForm 字段的名称、类型和当前值，并导出为 JSON 字符串
- [PDF 转 JSON 结构浏览器](https://elysiatools.com/zh/tools/pdf-to-json-structure-explorer): 提取 PDF 的 OpenDataLoader JSON 结构，并以浏览器视图查看标题、段落、表格、列表、页码和 bbox

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [CSV示例](https://elysiatools.com/zh/samples/csv-samples): 各种数据类型、大小和复杂度级别的CSV示例文件
- [Python 示例](https://elysiatools.com/zh/samples/python): Python代码示例和Hello World演示
- [Terraform Plan JSON 样本](https://elysiatools.com/zh/samples/terraform-plan-json-samples): 用于依赖可视化和变更审查的 Terraform plan JSON 文件样本，贴近 terraform show -json 输出结构

## 相关内容

- [文档 OCR 提取](https://elysiatools.com/zh/hubs/document-ocr-extraction): 从扫描件提取 OCR 文本，并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果，同时检查抽取质量。
- [PDF 转换、OCR 与内容提取工作流](https://elysiatools.com/zh/hubs/pdf-convert): 将办公文档、Wiki 页面、注释和图片转成 PDF，再从现有 PDF 中提取文本、图片、表格、结构或 OCR 文本层。
- [PDF 抽取与调试工作流](https://elysiatools.com/zh/hubs/pdf-extraction-debugging-workflows): 排查复杂 PDF 抽取失败：检查加密、安全风险、页范围、阅读顺序、OCR、表格、修订痕迹和结构化输出。
- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
