# PDF RAG 分块与引用包生成器

将 PDF 转成带页码、bbox 与标题路径的 RAG 分块 JSON，便于向量库入库和引用回链

> 标准页面: https://elysiatools.com/zh/tools/pdf-rag-chunker-citation-pack

- **分类:** AI Tools

- **关键词:** pdf, rag, citation, chunk

## 概述

上传 PDF 后，工具会调用 OpenDataLoader 输出 JSON，再把段落、列表、标题和表格整理成适合检索增强生成的 chunk。每个 chunk 都会附带页码、bounding box 和标题路径，方便向量检索、答案引用和 PDF 定位。

## 输入项

- **PDF 文件** (file)
- **分块模式** (select)
- **每块最大字符数** (number)
- **使用结构树** (checkbox)
- **脱敏敏感数据** (checkbox)
- **包含表格节点** (checkbox)

## 适用场景

- 构建需要提供精确引用来源（如页码和原文位置）的 AI 问答系统时。
- 处理包含复杂层级标题、列表或表格的 PDF 文档，且需要保留语义上下文时。
- 准备将大规模 PDF 文档库导入向量数据库（如 Pinecone、Milvus）进行索引时。

## 工作原理

- 上传 PDF 文件并配置分块参数，如选择“按标题聚合”模式以保持章节内容的语义完整性。
- 系统利用结构树解析技术提取文档中的段落、表格和列表，并记录每个元素在 PDF 中的物理坐标。
- 根据设定的最大字符数限制，将提取的语义节点合并为带有元数据的 JSON 分块包。
- 输出包含标题路径、页码和 Bounding Box 的 JSON 文件，直接对接向量化流水线。

## 使用案例

- 企业知识库构建：将内部规章制度 PDF 转为带引用的 RAG 数据源，实现精准问答。
- 法律合规审查：自动化处理法律条文，并在 AI 审查结果中直接链接到合同的具体条款位置。
- 学术文献检索：批量处理论文 PDF，生成带有章节路径和页码的索引，提升学术搜索的准确性。

## 常见问题

### “按标题聚合”和“逐元素分块”有什么区别？

按标题聚合会根据文档目录结构将内容归类，适合保持上下文；逐元素分块则将每个段落或表格视为独立块，适合精细化检索。

### 导出的 JSON 文件可以直接用于向量数据库吗？

可以，生成的 JSON 结构包含了文本内容及其对应的元数据，非常适合直接映射到向量数据库的 Metadata 字段。

### 工具如何处理 PDF 中的表格？

开启“包含表格节点”后，工具会将表格识别为独立单元，并保留其在文档中的位置信息，方便 AI 针对表格数据进行回答。

### Bounding Box 信息有什么用途？

Bounding Box 记录了文本在页面上的具体坐标，前端界面可以利用这些数据在 PDF 预览器中高亮显示 AI 引用的原文区域。

### 最大字符数设置多少比较合适？

通常建议设置在 500 到 1000 字符之间，这能平衡语义完整性与向量检索的精度，具体取决于您的 Embedding 模型限制。

## 相关工具

- [PDF 转 LLM 干净文本](https://elysiatools.com/zh/tools/pdf-to-clean-text-for-llm): 将 PDF 抽取成适合摘要、翻译、向量化和问答的干净纯文本
- [Markdown转PDF主题包](https://elysiatools.com/zh/tools/markdown-to-pdf-theme-pack): 将Markdown转换为PDF，支持深色/浅色/打印主题
- [PDF/A 转换](https://elysiatools.com/zh/tools/pdf-a-convert): 将 PDF 转换为自声明 PDF/A 归档格式，零外部依赖
- [PDF转Excel](https://elysiatools.com/zh/tools/pdf-to-excel): 从PDF文件中提取表格数据并转换为Excel电子表格，支持自定义解析选项
- [PDF转Markdown转换器](https://elysiatools.com/zh/tools/pdf-to-markdown): 将PDF文档转换为Markdown格式，支持文本提取和格式保留
- [PDF转文本增强版](https://elysiatools.com/zh/tools/pdf-to-text-advanced): 高级PDF转文本转换器，支持页码选择、格式选项和元数据提取
- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [时区协作排期器 ICS 样本](https://elysiatools.com/zh/samples/time-zone-workflow-scheduler-ics-samples): 与 Time Zone Workflow Scheduler 返回结构一致的 ICS 文件样本，包含多个候选会议 VEVENT
- [ASS 字幕样例](https://elysiatools.com/zh/samples/ass-samples): 从简单到复杂的 ASS 字幕文件，用于样式感知解析、翻译、转换和本地化 QA 测试

## 相关内容

- [文档 OCR 提取](https://elysiatools.com/zh/hubs/document-ocr-extraction): 从扫描件提取 OCR 文本，并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果，同时检查抽取质量。
- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
- [RAG 分块与检索准备](https://elysiatools.com/zh/hubs/rag-chunking-retrieval-prep): 清洗 PDF 与 Word 来源，移除抽取噪声，扫描隐藏提示风险，拆分文本，评分分块质量，并生成可引用的 RAG 输入。
