# 半结构化文本解析与表格提取

将定宽记录、混乱分隔文本、日志、Markdown 表格和 HTML 表格解析为 CSV、JSON、XML 或 Excel，并保留可复核的清理过程。

> 标准页面: https://elysiatools.com/zh/hubs/semi-structured-text-table-extraction

- **关键词:** 半结构化文本解析, 定宽文本解析, 混乱文本转 CSV, 日志解析, HTML 表格提取, CSV 异常行修复

## 常见问题

### 为什么把文本解析、表格提取和日志解析放在一起？

它们解决的是同一个交付问题：把不规则文本变成列稳定、假设清楚、可被下游信任的记录。

### 什么时候应该使用定宽解析？

当列由字符位置而不是分隔符定义时使用，例如遗留报表、主机导出或从终端复制的表格。

### 异常 CSV 行应该在转换前还是转换后修复？

通常先做一次结构化导出暴露行长问题，再在导入表格、数据库或分析工具之前修复。

### 这个工作流能自动推断完美 schema 吗？

不能。它可以推断结构并暴露异常，但列名、数据类型、必填字段和下游验收规则仍需要人工复核。

## 相关内容

- [表格数据格式转换工作流](https://elysiatools.com/zh/hubs/csv-convert): 在 CSV、电子表格、JSON、HTML 表格、Markdown、XML 和文本之间转换，同时检查表头、分隔符、类型与编码。
- [CSV 清理、重塑与交付工作流](https://elysiatools.com/zh/hubs/csv-utility): 检查 CSV 结构，保留正确列，重塑行数据，比较输出，并按需要拆分最终文件，支撑稳定导入或报表交付。
- [JSON 规范化与数据交换工作流](https://elysiatools.com/zh/hubs/json-convert): 把结构化来源转换为经过核对的 JSON 表示，再按下游需求导出为表格、配置、文档、API、XML、CSON、EDN、BSON 或 UBJSON。
- [HTML 内容提取、清理与交付工作流](https://elysiatools.com/zh/hubs/html-content-extraction-cleanup-and-delivery): 从 HTML 中提取链接、图片、属性和表格，去掉无关标记，并交付经过核对的 Markdown、PDF 或 CSV 输出。
- [数据质量与异常调查工作流](https://elysiatools.com/zh/hubs/data-quality-anomaly-workflows): 对表格数据做质量剖析，识别重复、缺失、参照断裂、离群和值班时序异常，并把发现整理成可辩护的质量证据。
