你是在生成 PDF,还是从 PDF 中提取内容?
最终交付物是 PDF 时选择文档和图片转换工具;PDF 是输入时选择文本、OCR、表格、图片、栅格化或 JSON 结构工具。
Elysia Tools
导航
Workflow Playbook
将办公文档、Wiki 页面、注释和图片转成 PDF,再从现有 PDF 中提取文本、图片、表格、结构或 OCR 文本层。
专题
将办公文档、Wiki 页面、注释和图片转成 PDF,再从现有 PDF 中提取文本、图片、表格、结构或 OCR 文本层。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
收集要处理的文档、图片或 PDF,并确认你有权处理这些文件。
先确定目标是发布归档、图片导出、OCR、表格提取、JSON 结构检查,还是准备给 LLM 使用的干净文本。
决策点: 你是在生成 PDF,还是从 PDF 中提取内容?. 最终交付物是 PDF 时选择文档和图片转换工具;PDF 是输入时选择文本、OCR、表格、图片、栅格化或 JSON 结构工具。
决策点: PDF 是否已经有可用文本层?. 数字 PDF 用直接文本提取;扫描页用 OCR 文本层;需要进入搜索、RAG、分析或自动化时,再选择干净文本或结构化提取。
先处理注释文档、Wiki 页面、演示稿、电子表格和文字文档,把原始资料变成可审阅、可分享的 PDF 包。 使用 doc-comment-to-pdf-docs, wiki-page-to-pdf, libreoffice-odp-to-pdf, libreoffice-ods-to-pdf, libreoffice-odt-to-pdf.
当收据、扫描件、截图、商品图或归档图片需要变成便携的页式文件时,将图片集合转换为 PDF。 使用 avif-to-pdf, gif-to-pdf, jpg-to-pdf, png-to-pdf, tiff-to-pdf, webp-to-pdf.
对已授权的加密文件先解锁;当下游需要页面图像而不是可编辑对象时,再导出图片或栅格化页面。 使用 encrypted-pdf-converter, pdf-to-image, pdf-rasterize-pages.
根据下游需要选择直接文本、OCR 文本层、LLM 干净文本、表格 CSV/JSON 或 PDF 结构检查。 使用 pdf-text-extractor, pdf-ocr-text-layer, pdf-to-clean-text-for-llm, pdf-to-json-structure-explorer, pdf-table-extractor-to-csv-json.
工作流指南
先处理注释文档、Wiki 页面、演示稿、电子表格和文字文档,把原始资料变成可审阅、可分享的 PDF 包。
当收据、扫描件、截图、商品图或归档图片需要变成便携的页式文件时,将图片集合转换为 PDF。
对已授权的加密文件先解锁;当下游需要页面图像而不是可编辑对象时,再导出图片或栅格化页面。
根据下游需要选择直接文本、OCR 文本层、LLM 干净文本、表格 CSV/JSON 或 PDF 结构检查。
最终交付物是 PDF 时选择文档和图片转换工具;PDF 是输入时选择文本、OCR、表格、图片、栅格化或 JSON 结构工具。
数字 PDF 用直接文本提取;扫描页用 OCR 文本层;需要进入搜索、RAG、分析或自动化时,再选择干净文本或结构化提取。