1. 标准 OCR 文本层生成
背景
用户拥有大量扫描的英文合同,无法直接复制其中的条款。
问题
需要将这些扫描件转换为可搜索的 PDF,以便在合同库中快速查找特定条款。
如何使用
上传 PDF 文件,保持默认的 300 DPI 和 eng 语言设置进行处理。
language: eng, dpi: 300, oem: 1, psm: 3结果
生成了一个保留原排版且支持全文搜索的 PDF 文件。
Elysia Tools
导航
PDF Tools
为扫描版 PDF 添加 OCR 文本层,使其可搜索/可复制
详情
先将PDF页面转为图片,再用 Tesseract 逐页OCR并合并,输出可检索可复制的文本层PDF。
执行
填写表单、运行工具,并在同一页面查看结果。
案例
相关内容
等待运行
工具使用指南
PDF OCR 文本层工具通过先进的 OCR 技术,为扫描版 PDF 文档添加可搜索和可复制的文本层,让原本无法选中的图片型文档瞬间变得高效易用。
背景
用户拥有大量扫描的英文合同,无法直接复制其中的条款。
问题
需要将这些扫描件转换为可搜索的 PDF,以便在合同库中快速查找特定条款。
如何使用
上传 PDF 文件,保持默认的 300 DPI 和 eng 语言设置进行处理。
language: eng, dpi: 300, oem: 1, psm: 3结果
生成了一个保留原排版且支持全文搜索的 PDF 文件。
背景
用户需要处理一份页数较多的扫描文档,对识别速度有较高要求。
问题
在保证基本识别准确率的前提下,尽可能缩短处理时间并控制文件体积。
如何使用
上传文件,将 DPI 调整为 200,并将页面分割模式(psm)设置为 6 以优化处理效率。
language: eng, dpi: 200, oem: 1, psm: 6结果
快速生成了可搜索的 PDF,且文件体积较小,便于网络传输。
OCR 文本层是在原有的 PDF 图片上方叠加的一层透明文字,它保留了原文档的视觉外观,同时赋予了文档可搜索和可复制的功能。
工具支持多种语言识别,您可以通过设置参数(如 eng 或 eng+chi_sim)来指定识别的语言类型。
通常 300 DPI 是平衡识别准确率与处理速度的最佳选择。过高的 DPI 会增加处理时间,过低则可能影响识别精度。
由于添加了额外的文本层,文件大小可能会略有增加,但通常在可接受范围内。
目前该工具支持单文件上传处理,您可以逐个上传并转换您的扫描文档。