应该先用通用提取器,还是直接用字段专用工具?
字段尚未确定时,用 `text-extractor` 对混合文本做快速摸底;字段、去重规则和用途都明确时,再选择 `bulk-url-extractor` 或其他专用提取器。
Elysia Tools
导航
Workflow Playbook
用清晰的提取路径,把混合文本中的链接、属性、日期、日志字段和敏感匹配结果整理成可复核的数据。
专题
这套工作流面向需要从原始文本、HTML、Markdown 或日志中得到可核对信号的人。打开工具前,先保留源文件,写清字段、输出形状、去重规则,以及复核者需要看到的上下文。一组小而明确的正例与负例,比一句“把所有内容提取出来”更适合作为验收依据。
字段尚未确定时,用 text-extractor 做第一轮扫描;如果任务已经明确是收集 URL,则使用 bulk-url-extractor 缩小范围。不要在判断属性或图片源是否重要之前就把 HTML 展平:先用 html-attribute-extractor 或 image-source-extractor,需要阅读文本时再用 new-html-tag-stripper 生成派生结果。Markdown 要交给 markdown-link-extractor,因为链接语法本身携带的信息可能会被纯文本掩盖。
对日志使用 ip-address-extractor 和 date-extractor 可以得到候选字段,但只有保留原始行、附近事件文本和时区假设,结果才真正可复核。把提取数量和代表性值与样本对比。匹配到的 IP 仍只是一个提取值,不等于身份结论;日期字符串也不会自动成为业务事件。
输入可能含有联系人或网络标识时,先决定授权范围和最小必要字段,再使用 bulk-email-extractor、phone-number-extractor 或 ip-address-extractor。限制原始输出的访问,记录交付了哪些字段和行,按要求对交付副本掩码或假名化。只有当预期字段存在、意外匹配得到解释、来源上下文仍在且交付物符合处理规则时,才接受结果。提取器不能替代脱敏或访问控制流程。
工作流指南
先保存未经修改的副本,写下预期字段。对混合文本做初步摸底时使用 `text-extractor`;如果任务明确只是收集 HTTP 和 HTTPS 链接,就直接使用 `bulk-url-extractor`。保留这份基线,方便和后续专用结果比较。
HTML 的属性、链接或图片源有用时,先用 `html-attribute-extractor` 或 `image-source-extractor`,再用 `new-html-tag-stripper` 生成纯文本版本。Markdown 使用 `markdown-link-extractor` 保留链接语法,并把链接清单与可读文本分开复核。
用 `ip-address-extractor` 提取 IPv4 和 IPv6 候选值,用 `date-extractor` 识别混合记录中的日期。保留原始日志行、附近事件内容和时区假设,以便复核;不要据此断言 IP 对应某个人,也不要擅自解释日期的业务含义。
授权任务确实需要联系人或网络标识时,用 `bulk-email-extractor`、`phone-number-extractor`,必要时再用 `ip-address-extractor` 建立最小字段清单。用样本核对数量,限制原始值访问,并在交付前按规则掩码或假名化;这些工具识别候选值,但不会自动匿名化。
字段尚未确定时,用 `text-extractor` 对混合文本做快速摸底;字段、去重规则和用途都明确时,再选择 `bulk-url-extractor` 或其他专用提取器。
HTML 中的属性和图片源有意义时,应先用对应工具提取,再用 `new-html-tag-stripper` 生成纯阅读文本。Markdown 要用 `markdown-link-extractor` 区分内联链接、引用链接和纯 URL;日志则应按行和事件记录处理,而不是当成一段普通文章。
只有在获得授权且确有必要时,才提取邮箱、电话或 IP,并限制到最小范围。原始值要受访问控制,交付时按规则掩码或假名化;提取器只负责识别候选值,不是匿名化或合规控制。