最终可复用产物是什么?
文本后续还要编辑就选 Markdown,需要稳定版式审阅就选 PDF,只有真正的表格数据才应导出为 CSV。
Elysia Tools
导航
Workflow Playbook
从 HTML 中提取链接、图片、属性和表格,去掉无关标记,并交付经过核对的 Markdown、PDF 或 CSV 输出。
专题
从 HTML 中提取链接、图片、属性和表格,去掉无关标记,并交付经过核对的 Markdown、PDF 或 CSV 输出。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
使用具有代表性的 HTML 文件或页面存档,保证后续核对都基于同一份来源。
先明确最终要沉淀的是可编辑 Markdown、定版 PDF、表格 CSV,还是三者组合。
在清理前列出必须保留的标签、属性、表格和媒体引用,避免误删有效内容。
决策点: 最终可复用产物是什么?. 文本后续还要编辑就选 Markdown,需要稳定版式审阅就选 PDF,只有真正的表格数据才应导出为 CSV。
决策点: 哪些标记是正文信号,哪些是页面噪声?. 把导航、埋点属性、脚本、内联样式和装饰容器,与真正需要保留的链接、图片、标题和正文区分开。
决策点: 如何证明输出还能复用?. 提前设计核对方式,确认转换后标题、链接目标、图片引用、表格行列和可见文本都没有跑偏。
先抽取 HTML 属性、链接目标、图片来源和候选表格,建立一份结构清单,明确后续清理绝不能丢掉哪些元素。 使用 html-attribute-extractor, image-source-extractor, html-table-to-csv.
剥离无关标签并压缩冗余标记,但要保护承载标题、正文、引用和表格语义的节点,不把内容清理成只有纯文本。 使用 html-tag-stripper, html-minifier, html-tags.
把清理后的 HTML 转成可编辑 Markdown、版式稳定的 PDF,或两者同时产出;PDF 工具要根据原页面样式和分页要求来选。 使用 html-to-markdown, html-to-pdf-precise, html-to-pdf-renderer.
对生成物再次检查表格、链接、图片和编码文本,确保接收方不打开原页面也能继续引用、审阅或再加工。 使用 html-table-to-csv, html-attribute-extractor, html-entity-encoder.
html-to-pdf-precise;需要更接近浏览器渲染现代 HTML/CSS 时更适合 html-to-pdf-renderer。工作流指南
先抽取 HTML 属性、链接目标、图片来源和候选表格,建立一份结构清单,明确后续清理绝不能丢掉哪些元素。
剥离无关标签并压缩冗余标记,但要保护承载标题、正文、引用和表格语义的节点,不把内容清理成只有纯文本。
把清理后的 HTML 转成可编辑 Markdown、版式稳定的 PDF,或两者同时产出;PDF 工具要根据原页面样式和分页要求来选。
对生成物再次检查表格、链接、图片和编码文本,确保接收方不打开原页面也能继续引用、审阅或再加工。
文本后续还要编辑就选 Markdown,需要稳定版式审阅就选 PDF,只有真正的表格数据才应导出为 CSV。
把导航、埋点属性、脚本、内联样式和装饰容器,与真正需要保留的链接、图片、标题和正文区分开。
提前设计核对方式,确认转换后标题、链接目标、图片引用、表格行列和可见文本都没有跑偏。