需要先做 OCR,还是可以直接复用现有文本层?
页面只有图片时走 OCR;PDF 已有可靠可选中文本时优先直接提取。
Elysia Tools
导航
Workflow Playbook
从扫描件提取 OCR 文本,并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果,同时检查抽取质量。
专题
从扫描件提取 OCR 文本,并把文档页面或图片转换为 Markdown、JSON、表格、图像说明和可用于检索的分块结果,同时检查抽取质量。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
使用将被归档或进入下游系统的确切扫描件、图片集或 PDF 版本。
先确认来源是纯扫描、已有文本层,还是数字页与扫描页混合。
开始前记录目标输出形态:Markdown、纯文本、JSON 字段、表格、图像说明或带引用的分块。
决策点: 需要先做 OCR,还是可以直接复用现有文本层?. 页面只有图片时走 OCR;PDF 已有可靠可选中文本时优先直接提取。
决策点: 目标是通用文档、专用表单,还是表格密集文件?. 收据和身份证优先走专用 JSON 抽取;表格页优先走表格提取;叙述性文档更适合 Markdown 或纯文本。
决策点: 应该处理整份文件,还是先截取关键页?. 如果封面、附录或低价值页面会拉低质量并增加复核成本,就先裁剪页范围再抽取。
先判断整份文件是否都需要 OCR,还是只需处理部分页面,再截取真正相关的页范围。 使用 pdf-page-range-extractor.
扫描页走 OCR,已有可用文本层的 PDF 直接提取,并保留原始输出用于后续比对。 使用 pdf-ocr-text-layer, scanned-pdf-ocr-to-markdown, pdf-text-extractor, pdf-to-markdown, pdf-to-clean-text-for-llm.
当下游任务需要明确语义时,把文档进一步转成结构 JSON、表格、收据字段、证件字段或页面图片说明。 使用 pdf-to-json-structure-explorer, pdf-table-extractor-to-csv-json, ai-image-to-receipt-json, ai-ocr-id-card-to-json, pdf-image-caption-extractor, ai-image-to-markdown.
把已复核内容打包成带引用的检索分块,并在入库搜索或 RAG 前,对照源文件检查关键标题、金额、姓名、日期和表格。 使用 pdf-rag-chunker-citation-pack.
工作流指南
先判断整份文件是否都需要 OCR,还是只需处理部分页面,再截取真正相关的页范围。
扫描页走 OCR,已有可用文本层的 PDF 直接提取,并保留原始输出用于后续比对。
当下游任务需要明确语义时,把文档进一步转成结构 JSON、表格、收据字段、证件字段或页面图片说明。
把已复核内容打包成带引用的检索分块,并在入库搜索或 RAG 前,对照源文件检查关键标题、金额、姓名、日期和表格。
页面只有图片时走 OCR;PDF 已有可靠可选中文本时优先直接提取。
收据和身份证优先走专用 JSON 抽取;表格页优先走表格提取;叙述性文档更适合 Markdown 或纯文本。
如果封面、附录或低价值页面会拉低质量并增加复核成本,就先裁剪页范围再抽取。