# PDF OCR 文本层

为扫描版 PDF 添加 OCR 文本层，使其可搜索/可复制

> 标准页面: https://elysiatools.com/zh/tools/pdf-ocr-text-layer

- **分类:** PDF Tools

- **关键词:** pdf, ocr, tesseract, searchable, copyable, scan

## 概述

先将PDF页面转为图片，再用 Tesseract 逐页OCR并合并，输出可检索可复制的文本层PDF。

## 输入项

- **源PDF文件** (file): Upload scanned PDF
- **OCR语言** (text): eng or eng+chi_sim
- **输入DPI** (number)
- **OCR引擎模式** (number)
- **页面分割模式** (number)

## 适用场景

- 需要从扫描件或纸质文档的 PDF 中提取文字内容时。
- 希望对归档的扫描版 PDF 进行全文搜索以快速定位信息时。
- 需要将图片格式的 PDF 转换为可编辑、可复制的文档格式时。

## 工作原理

- 上传您的扫描版 PDF 文件。
- 根据文档语言和清晰度，选择合适的 OCR 语言及 DPI 设置。
- 工具将自动将页面转换为图像，利用 Tesseract 引擎进行逐页识别。
- 系统将识别出的文本层与原文档合并，生成可搜索的 PDF 文件。

## 使用案例

- 法律与财务文档的数字化归档与全文检索。
- 学术研究中对扫描版古籍或文献的文字提取。
- 办公场景下将纸质合同扫描件转换为可复制的电子文档。

## 常见问题

### 什么是 OCR 文本层？

OCR 文本层是在原有的 PDF 图片上方叠加的一层透明文字，它保留了原文档的视觉外观，同时赋予了文档可搜索和可复制的功能。

### 支持哪些语言的识别？

工具支持多种语言识别，您可以通过设置参数（如 eng 或 eng+chi_sim）来指定识别的语言类型。

### DPI 设置越高越好吗？

通常 300 DPI 是平衡识别准确率与处理速度的最佳选择。过高的 DPI 会增加处理时间，过低则可能影响识别精度。

### 处理后的 PDF 文件大小会变大吗？

由于添加了额外的文本层，文件大小可能会略有增加，但通常在可接受范围内。

### 该工具支持批量处理吗？

目前该工具支持单文件上传处理，您可以逐个上传并转换您的扫描文档。

## 相关工具

- [PDF去噪](https://elysiatools.com/zh/tools/pdf-denoise): 使用真实图像处理算法去除扫描PDF页面的视觉噪点——椒盐噪点、随机颗粒以及背景灰雾。文字页保留为可搜索的矢量内容。
- [扫描 PDF OCR 转 Word](https://elysiatools.com/zh/tools/scanned-pdf-ocr-to-word): 将扫描 PDF 页面栅格化，用 Tesseract 识别文字并导出可编辑 DOCX。
- [PDF 在线添加签名](https://elysiatools.com/zh/tools/pdf-add-signature-online): 在 PDF 页面上添加可见文字签名或签名图片并下载新文件
- [批量 PDF 水印](https://elysiatools.com/zh/tools/pdf-batch-watermark): 批量为多个 PDF 文件添加文字水印，支持旋转、透明度和平铺选项
- [OCR PDF 转结构化 JSON 桥](https://elysiatools.com/zh/tools/ocr-pdf-to-structured-json-bridge): 按几何结构抽取 PDF 文本层（y 坐标分行、列间隙识表、字号识标题、冒号键值对），然后逐字段填入用户提供的 JSON Schema——标签按归一化键名匹配、值按声明类型归一化，并用 ajv 校验。
- [PDF去歪斜](https://elysiatools.com/zh/tools/pdf-deskew): 自动检测并校正PDF页面歪斜（倾斜）。保留文字页的可搜索矢量内容，仅对图片页（如扫描件）进行栅格化处理。
- [PDF 页眉页脚噪音清理器](https://elysiatools.com/zh/tools/pdf-header-footer-noise-remover): 对比保留与去掉页眉页脚的抽取结果，定位重复页面装饰对文本清洗的污染
- [邮件HTML转PDF](https://elysiatools.com/zh/tools/libreoffice-html-mail-to-pdf): 将邮件HTML内容渲染为PDF并保留基础排版

## 示例

- [PDF示例](https://elysiatools.com/zh/samples/pdf-samples): 2026-02-01 到 2026-02-10 工具生成的PDF示例
- [Markdown 幻灯片示例](https://elysiatools.com/zh/samples/md-slide-deck-to-pdf): 用于测试 PDF 导出的 Remark/Marp 风格 Markdown 幻灯片
- [中英混合文本示例](https://elysiatools.com/zh/samples/text-chinese-english-mixed-samples): 用于测试自动添加空格工具的中英文混合内容示例文本文件
- [大小写转换样本](https://elysiatools.com/zh/samples/text-case-formats): 不同命名约定之间的大小写转换测试样本

## 相关内容

- [PDF 归档、可访问性与可信交付审查](https://elysiatools.com/zh/hubs/pdf-archival-accessibility-trust): 清理扫描页、添加 OCR、准备 PDF/A、检查可访问结构、补充书签，并在归档交付前验证签名。
- [PDF LLM 与 RAG 入库准备](https://elysiatools.com/zh/hubs/pdf-llm-rag-prep): 把 PDF 转成干净、安全、可引用的 LLM 摘要、嵌入、搜索和 RAG 输入。
- [文档 OCR 提取](https://elysiatools.com/zh/hubs/document-ocr-extraction): 从扫描件提取 OCR 文本，并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果，同时检查抽取质量。
- [PDF 转换、OCR 与内容提取工作流](https://elysiatools.com/zh/hubs/pdf-convert): 将办公文档、Wiki 页面、注释和图片转成 PDF，再从现有 PDF 中提取文本、图片、表格、结构或 OCR 文本层。
