# 扫描版 PDF OCR 转 Markdown

将扫描版或图片型 PDF 转成 Markdown，优先走 OpenDataLoader hybrid OCR，并在后端不可用时优雅回退

> 标准页面: https://elysiatools.com/zh/tools/scanned-pdf-ocr-to-markdown

- **分类:** AI Tools

- **关键词:** pdf, ocr, markdown

## 概述

上传扫描版 PDF 后，工具会优先尝试 OpenDataLoader hybrid OCR，将结果导出为 Markdown；如果当前环境没有 hybrid 后端，它也会自动回退到标准提取，并在 metadata 中清楚标记回退原因。

## 输入项

- **PDF 文件** (file)
- **页码范围** (text): e.g. 1,3,5-7
- **保留换行** (checkbox)
- **插入分页标记** (checkbox)
- **Hybrid 后端地址** (text): http://127.0.0.1:5002
- **优先使用 Hybrid OCR** (checkbox)

## 适用场景

- 需要将纸质文档的扫描件转换为可编辑、可搜索的 Markdown 文本时。
- 处理包含大量图片且无法直接复制文字的 PDF 报告或电子书时。
- 准备将 PDF 内容导入 Obsidian、Notion 等支持 Markdown 的知识库管理工具时。

## 工作原理

- 用户上传 PDF 文件并根据需要指定转换的页码范围（如 1,3,5-10）。
- 系统优先调用 OpenDataLoader 混合 OCR 引擎对图像内容进行深度文字识别与结构解析。
- 若混合 OCR 后端未响应或不可用，系统将自动回退至标准提取模式并记录回退原因。
- 根据用户设置的换行和分页选项，将识别结果格式化并导出为 Markdown 文件。

## 使用案例

- 数字化历史档案：将旧版纸质书籍的扫描 PDF 批量转换为 Markdown 格式进行数字化存档。
- 调研报告整理：从图片格式的行业报告中快速提取文字，方便引用到个人笔记或研究论文中。
- 自动化文档处理：将扫描合同或发票 PDF 转换为 Markdown，以便后续进行 AI 摘要提取或数据分析。

## 常见问题

### 该工具支持哪些类型的 PDF？

主要针对扫描版 PDF 或纯图片 PDF，同时也支持包含文字层的混合型 PDF 文档。

### 转换后会保留原始排版吗？

工具会将内容转换为 Markdown 语法，保留基本的文本段落结构，但复杂的视觉布局会进行简化处理。

### 什么是“混合 OCR”模式？

这是一种结合了多种识别算法的高级模式，能更精准地处理复杂页面布局，提高文字识别的准确度。

### 如果 OCR 识别失败了会怎样？

工具会自动回退到标准提取模式，并在生成的元数据中明确标记回退原因，确保您仍能获得基础文本。

### 可以只转换 PDF 的特定页面吗？

可以，在“页码范围”选项中输入具体的页码或范围（例如 1,3,5-7）即可实现局部转换。

## 相关工具

- [Markdown转PDF转换器](https://elysiatools.com/zh/tools/markdown-to-pdf-converter): 将Markdown文件转换为PDF文档，支持格式化、语法高亮和样式
- [PDF页眉页脚片段](https://elysiatools.com/zh/tools/pdf-header-footer-snippets): 将HTML转换为PDF，并插入Logo/标题/日期等页眉页脚片段
- [PDF 转结构化 Markdown 转换器](https://elysiatools.com/zh/tools/pdf-to-structured-markdown-converter): 基于 OpenDataLoader 将 PDF 转成结构化 Markdown，支持 HTML 富文本、图片引用和分页标记
- [Data URI 生成器](https://elysiatools.com/zh/tools/data-uri-generator): 将文件转换为 Data URI（Base64 或百分号编码），用于直接在 HTML、CSS 或 Markdown 中内联图片、字体等资源
- [加密 PDF 转换器](https://elysiatools.com/zh/tools/encrypted-pdf-converter): 输入正确密码后解析受保护 PDF，并导出为 Markdown、JSON 或文本
- [Markdown报告打包器](https://elysiatools.com/zh/tools/markdown-report-bundler): 将多个Markdown文件打包为单个PDF报告
- [Markdown转PDF主题包](https://elysiatools.com/zh/tools/markdown-to-pdf-theme-pack): 将Markdown转换为PDF，支持深色/浅色/打印主题
- [PDF转Markdown转换器](https://elysiatools.com/zh/tools/pdf-to-markdown): 将PDF文档转换为Markdown格式，支持文本提取和格式保留

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [Markdown 示例](https://elysiatools.com/zh/samples/markdown-samples): Markdown 格式示例，从简单到复杂的文档结构
- [Markdown 查看器样本](https://elysiatools.com/zh/samples/markdown-viewer-samples): 用于 README 预览、文档渲染和富文本标记测试的 Markdown 样本文件

## 相关内容

- [RAG 分块与检索准备](https://elysiatools.com/zh/hubs/rag-chunking-retrieval-prep): 清洗 PDF 与 Word 来源，移除抽取噪声，扫描隐藏提示风险，拆分文本，评分分块质量，并生成可引用的 RAG 输入。
- [PDF 抽取与调试工作流](https://elysiatools.com/zh/hubs/pdf-extraction-debugging-workflows): 排查复杂 PDF 抽取失败：检查加密、安全风险、页范围、阅读顺序、OCR、表格、修订痕迹和结构化输出。
- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
- [文档编写、审阅与发布](https://elysiatools.com/zh/hubs/documentation-authoring-publishing): 先从代码、PDF 或 HTML 提取资料，再完成 Markdown 整理、合并、预览和发布导出。
