# 从文本、HTML、Markdown 与日志提取结构化信号

用清晰的提取路径，把混合文本中的链接、属性、日期、日志字段和敏感匹配结果整理成可复核的数据。

> 标准页面: https://elysiatools.com/zh/hubs/text-extract

- **关键词:** 文本提取工作流, 结构化信号提取, HTML 属性提取, Markdown 链接提取, 日志字段提取, 敏感字段复核

## 常见问题

### 这套工作流支持哪些来源？

它支持原始或混合文本、HTML 源码、Markdown 文档和按行组织的日志。应根据来源结构选择提取器，而不是把所有输入都当成普通文本。

### 什么时候专用提取器比 `text-extractor` 更合适？

不熟悉输入、需要同时查看多种常见模式时，先用通用工具；字段明确、需要固定去重规则或格式语法检查时，使用专用工具。

### 这套工作流会自动匿名化邮箱、电话号码或 IP 吗？

不会。列出的工具只提取候选值。授权、最小化、掩码或假名化、访问控制、保留期限和最终发布复核应遵循你自己的处理规则；更窄的日志脱敏路径可参考相关 PII 日志脱敏工作流。

## 相关内容

- [HTML 内容提取、清理与交付工作流](https://elysiatools.com/zh/hubs/html-content-extraction-cleanup-and-delivery): 从 HTML 中提取链接、图片、属性和表格，去掉无关标记，并交付经过核对的 Markdown、PDF 或 CSV 输出。
- [半结构化文本解析与表格提取](https://elysiatools.com/zh/hubs/semi-structured-text-table-extraction): 将定宽记录、混乱分隔文本、日志、Markdown 表格和 HTML 表格解析为 CSV、JSON、XML 或 Excel，并保留可复核的清理过程。
- [PII 检测与日志脱敏复核](https://elysiatools.com/zh/hubs/pii-log-redaction): 在日志、文本和 PDF 中发现疑似个人信息，生成脱敏候选稿，校验标识符模式，并在共享前要求人工审批。
- [正则测试、可视化与安全审查工作流](https://elysiatools.com/zh/hubs/regex-utility): 通过语法参考、匹配测试、结构可视化、替换预览、性能对比和 ReDoS 扫描，构建更可靠的正则表达式。
