1. 识别扫描 PDF 的前两页
行政人员背景
行政人员收到一份扫描版多页 PDF,需要先将开头两页转换成可编辑文字。
问题
整份文件包含较多页面,手动复制扫描内容效率较低。
如何使用
上传 `sample-multipage.pdf`,选择英语,页码填写 `1-2`,然后导出 DOCX。
语言:英语(eng);页码:1-2;DPI:200;页面分割模式:3;OCR 引擎模式:1;包含分页标题:是。结果
前两页中的识别文字会写入可编辑的 Word 段落,并生成 DOCX 文件。
Elysia Tools
导航
PDF Tools
将扫描 PDF 页面栅格化,用 Tesseract 识别文字并导出可编辑 DOCX。
详情
使用 Poppler 或 Ghostscript 渲染选定页面,在本地运行 Tesseract,并将识别文字写入可编辑 Word 段落。复杂表格和手写内容可能需要人工整理。
执行
填写表单、运行工具,并在同一页面查看结果。
案例
相关内容
等待运行
工具使用指南
扫描 PDF OCR 转 Word工具可将扫描版 PDF 页面栅格化,使用 Tesseract 识别文字,并导出为可编辑的 DOCX 文件。你可以选择 OCR 语言、处理页码、DPI、页面分割模式和 OCR 引擎模式;复杂表格与手写内容可能需要人工整理。
背景
行政人员收到一份扫描版多页 PDF,需要先将开头两页转换成可编辑文字。
问题
整份文件包含较多页面,手动复制扫描内容效率较低。
如何使用
上传 `sample-multipage.pdf`,选择英语,页码填写 `1-2`,然后导出 DOCX。
语言:英语(eng);页码:1-2;DPI:200;页面分割模式:3;OCR 引擎模式:1;包含分页标题:是。结果
前两页中的识别文字会写入可编辑的 Word 段落,并生成 DOCX 文件。
背景
研究人员需要整理一份同时包含英文和简体中文的扫描资料。
问题
单一语言设置可能无法覆盖文档中的双语正文。
如何使用
上传扫描 PDF,将 OCR 语言设置为英语 + 简体中文(eng+chi_sim),必要时指定页码范围。
语言:英语 + 简体中文(eng+chi_sim);DPI:300;页面分割模式:3;OCR 引擎模式:1。结果
工具会使用双语 OCR 设置识别选定页面,并导出包含识别文字的可编辑 DOCX。
支持上传 PDF 文件,单个文件大小上限为 50 MB。
可以。在页码选择中输入页码或范围,例如“1,3-5”;留空则识别全部页面。
支持英语、简体中文、繁体中文、日语、韩语、阿拉伯语、印地语、俄语、法语、德语、西班牙语、葡萄牙语、意大利语、越南语和泰语等。
输出为可编辑的 DOCX Word 文件,识别文字会写入 Word 段落。
复杂表格和手写内容可能需要人工检查和整理。