# PDF 图片与 Caption 提取器

提取 PDF 图片、匹配附近 caption，并生成可浏览的 HTML 图文索引

> 标准页面: https://elysiatools.com/zh/tools/pdf-image-caption-extractor

- **分类:** Media

- **关键词:** pdf, image, caption

## 概述

上传 PDF 后，工具会导出图片资源、解析结构化 JSON，并按照页码和位置为每张图匹配附近的 caption，最后生成可浏览的 HTML 报告。

## 输入项

- **PDF 文件** (file)
- **图片格式** (select)
- **页码范围** (text): e.g. 1,3,5-7
- **使用结构树** (checkbox)

## 适用场景

- 需要从学术论文或教科书中批量提取插图及其对应的文字说明时。
- 整理企业年度报告或技术文档中的图表，并需要保留其上下文描述时。
- 归档设计文档或产品手册中的视觉资产，以便快速检索和分类时。

## 工作原理

- 上传需要处理的 PDF 文件，并根据需要指定特定的页码范围和输出图片格式（PNG 或 JPEG）。
- 系统解析 PDF 的内部结构树，提取嵌入的图像资源并将其转换为指定的图像格式。
- 算法自动扫描图像周边的文本块，根据空间位置关系识别并关联最匹配的 Caption 说明文字。
- 汇总所有提取的图文信息，生成一个包含图片预览、对应文字及页码信息的 HTML 索引包。

## 使用案例

- 论文文献整理：快速提取数百篇 PDF 论文中的实验图表和图注，方便撰写综述或进行学术汇报。
- 电商画册归档：从 PDF 格式的产品目录中批量提取商品图片和对应的型号、规格描述。
- 教学素材制作：教师从电子教材中批量获取插图和解释文字，用于制作高质量的教学课件。

## 常见问题

### 支持导出哪些图片格式？

目前支持将 PDF 中的图片导出为 PNG 或 JPEG 格式。

### “使用结构树”选项有什么作用？

开启后，工具将利用 PDF 内部的语义结构信息，从而更准确地匹配图片与其对应的标题文字。

### 我可以只提取特定页面的图片吗？

可以，在“页码范围”输入框中指定如“1,3,5-10”即可仅处理特定页面。

### 提取后的结果如何查看？

工具会生成一个 HTML 文件，您可以直接在任何现代浏览器中打开，查看所有提取出的图片及其匹配的说明。

### 如果图片在 PDF 中没有说明文字会怎样？

工具仍会提取该图片，但对应的 Caption 字段将为空，或仅显示其所在的页码位置。

## 相关工具

- [Data URI 生成器](https://elysiatools.com/zh/tools/data-uri-generator): 将文件转换为 Data URI（Base64 或百分号编码），用于直接在 HTML、CSS 或 Markdown 中内联图片、字体等资源
- [PDF发票生成器](https://elysiatools.com/zh/tools/pdf-invoice-generator): 使用结构化明细生成带品牌的发票PDF
- [PDF 转结构化 Markdown 转换器](https://elysiatools.com/zh/tools/pdf-to-structured-markdown-converter): 基于 OpenDataLoader 将 PDF 转成结构化 Markdown，支持 HTML 富文本、图片引用和分页标记
- [PDF 表格提取到 CSV/JSON](https://elysiatools.com/zh/tools/pdf-table-extractor-to-csv-json): 用 OpenDataLoader 从 PDF 中抽取表格，并导出为结构化 JSON、扁平 CSV 或 HTML 表格
- [PDF页眉页脚片段](https://elysiatools.com/zh/tools/pdf-header-footer-snippets): 将HTML转换为PDF，并插入Logo/标题/日期等页眉页脚片段
- [批量条码生成器](https://elysiatools.com/zh/tools/barcode-batch-generator): 从 CSV 或多行文本批量生成 Code 128、EAN-13、UPC-A、ITF-14、QR Code 和 Data Matrix，并导出 PNG ZIP 或 PDF
- [AVIF转PDF转换器](https://elysiatools.com/zh/tools/avif-to-pdf): 将AVIF图像转换为PDF格式，支持自定义页面大小、方向和质量设置
- [GIF转PDF转换器](https://elysiatools.com/zh/tools/gif-to-pdf): 将GIF图像转换为PDF格式，支持单帧和多帧动画处理

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [Docker镜像标签示例](https://elysiatools.com/zh/samples/docker-image-tag): 各种Docker镜像引用集合，包含不同的registry、repository、tag和digest
- [变更日志提取器样本](https://elysiatools.com/zh/samples/changelog-extractor): 用于测试变更日志解析和提取工具的各种变更日志格式

## 相关内容

- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
- [文档 OCR 提取](https://elysiatools.com/zh/hubs/document-ocr-extraction): 从扫描件提取 OCR 文本，并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果，同时检查抽取质量。
