第一步应从源码中提取什么?
HTML 先提取属性、图片源和 meta 信息;Markdown 使用链接提取器;表格导出为 CSV;只有在需要可读文本视图时才清除 HTML 标签。先保留实际证据,不要对猜测出来的清单做验证。
Elysia Tools
导航
Workflow Playbook
在复用、迁移或发布前提取源码证据,检查链接与资源,分析元数据和查询串,并复核 RSS/Atom 与 robots.txt。
专题
在复用、迁移或发布前提取源码证据,检查链接与资源,分析元数据和查询串,并复核 RSS/Atom 与 robots.txt。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
准备获准审查的源码快照,例如 HTML、Markdown、表格片段、原始 Feed XML、robots.txt 或 URL 列表,并记录来源和时间。
明确本次属于内容复用、迁移还是发布,列出下游团队需要接收的证据字段。
提前约定允许的域名、路径或 query 映射、必查 metadata 字段,以及项目自己的接受或阻断门槛。
决策点: 第一步应从源码中提取什么?. HTML 先提取属性、图片源和 meta 信息;Markdown 使用链接提取器;表格导出为 CSV;只有在需要可读文本视图时才清除 HTML 标签。先保留实际证据,不要对猜测出来的清单做验证。
决策点: 你要验证静态结构,还是要证明线上可达?. Markdown Link Checker 只检查语法、锚点和引用定义,不发网络请求。Bulk URL Extractor 与 Domain Extractor 用来去重和分类现有 URL,不能据此证明每个目标地址都能在线访问。
决策点: 哪些暴露面检查应放在最后?. 完成 query 归类后,再检查给定的 RSS/Atom Feed,并用 robots.txt 工具核对重要 URL。它们说明读者、集成方和爬虫可能看到的暴露规则,不是页面质量或搜索排名结论。
保留 HTML 原文,提取 href、src、data 属性、懒加载或 srcset 图片地址,以及 meta、Open Graph、Twitter Card 和结构化数据字段。任何改写之前,都把原始源码和提取清单一起归档。 使用 html-attribute-extractor, image-source-extractor, meta-tag-extractor.
按输入类型分支:表格数据重要时导出 CSV,标签妨碍阅读时生成纯文本视图,Markdown 文档则提取行内链接、引用链接和裸 URL。每份结果都要关联回原文件或原章节。 使用 html-table-to-csv, new-html-tag-stripper, markdown-link-extractor.
先对提取出的 Markdown 文档运行静态检查,找出格式错误、失效锚点和未定义引用;再去重 HTTP/HTTPS URL 并归类域名,把站内、外部、资源和意外目标分开审阅。 使用 markdown-link-checker, bulk-url-extractor, domain-extractor.
从 URL 清单中解析路径片段、哈希和参数,比较参数键频率、值样例与编码异常。对跟踪、筛选、分页或内容选择参数分别决定迁移时保留、映射还是排除,不要静默丢弃。 使用 url-parameter-extractor, url-query-analyzer.
解析给定 RSS/Atom URL 或 XML,查看条目顺序、日期、重复项和 Markdown 摘要;随后检查 robots.txt 语法并用重要 URL 测试规则。把两份结果附在决策记录中,并注明未做的线上或未授权检查。 使用 rss-feed-markdown-summarizer, robots-txt-lint-validator.
工作流指南
保留 HTML 原文,提取 href、src、data 属性、懒加载或 srcset 图片地址,以及 meta、Open Graph、Twitter Card 和结构化数据字段。任何改写之前,都把原始源码和提取清单一起归档。
按输入类型分支:表格数据重要时导出 CSV,标签妨碍阅读时生成纯文本视图,Markdown 文档则提取行内链接、引用链接和裸 URL。每份结果都要关联回原文件或原章节。
先对提取出的 Markdown 文档运行静态检查,找出格式错误、失效锚点和未定义引用;再去重 HTTP/HTTPS URL 并归类域名,把站内、外部、资源和意外目标分开审阅。
从 URL 清单中解析路径片段、哈希和参数,比较参数键频率、值样例与编码异常。对跟踪、筛选、分页或内容选择参数分别决定迁移时保留、映射还是排除,不要静默丢弃。
解析给定 RSS/Atom URL 或 XML,查看条目顺序、日期、重复项和 Markdown 摘要;随后检查 robots.txt 语法并用重要 URL 测试规则。把两份结果附在决策记录中,并注明未做的线上或未授权检查。
HTML 先提取属性、图片源和 meta 信息;Markdown 使用链接提取器;表格导出为 CSV;只有在需要可读文本视图时才清除 HTML 标签。先保留实际证据,不要对猜测出来的清单做验证。
Markdown Link Checker 只检查语法、锚点和引用定义,不发网络请求。Bulk URL Extractor 与 Domain Extractor 用来去重和分类现有 URL,不能据此证明每个目标地址都能在线访问。
完成 query 归类后,再检查给定的 RSS/Atom Feed,并用 robots.txt 工具核对重要 URL。它们说明读者、集成方和爬虫可能看到的暴露规则,不是页面质量或搜索排名结论。