# 表格数据的清洗、整形与归一化

把杂乱的表格数据做成可分析的——合并各源表为一张、剥掉破坏列匹配的 BOM 字符、只留要用的列、修拼写统一格式、按既定策略而非慌乱处理离群值、缩放或标准化数值，最后做范围限幅并给出交叉汇总表。

> 标准页面: https://elysiatools.com/zh/hubs/tabular-data-cleanup-and-normalization

- **关键词:** 清洗表格数据, 合并数据表, 去除 CSV BOM, 抽取数据列, 离群值检测与处理, Min-Max 归一化, Z-score 标准化, 数值限幅

## 常见问题

### BOM 是什么，为什么会弄坏我的连接？

字节顺序标记是一个不可见字符，某些导出工具——Excel 是其中之一——会把它粘在 UTF-8 文件开头。第一列的列名从此带上幽灵前缀，与手写的同一列名做精确匹配时静默失败——join 返回空却没有报错。匹配前剥掉它只需一步。

### 为什么先合并再清洗？

因为格式漂移藏在表与表之间——同一个类别在三份导出里拼成三种样子，在一张表里相遇时是一个问题，分开清洗时是三个问题。先合并、列匹配一次做完，再清洗一次，每条约定都同时作用于全量数据。

### 删掉离群值总是安全的默认选项吗？

不是——删除是对世界的判断，不是卫生规则。极端值可能是该移除的传感器故障，也可能是你专程来研究的最重要事件。看分布、问业务含义，拿不准时标记而不是删除——分析可以无视一个标记，但没法撤销一次删除。

### 树模型也需要归一化吗？

多数不需要——决策树及其集成按顺序分裂、不按距离，缩放对它们毫无改变。这一步的价值在基于距离与梯度的方法上——聚类、最近邻、带正则的回归、神经网络。缩放之前先弄清你的消费者是谁。

## 相关内容

- [半结构化文本解析与表格提取](https://elysiatools.com/zh/hubs/semi-structured-text-table-extraction): 将定宽记录、混乱分隔文本、日志、Markdown 表格和 HTML 表格解析为 CSV、JSON、XML 或 Excel，并保留可复核的清理过程。
- [CSV 清理、重塑与交付工作流](https://elysiatools.com/zh/hubs/csv-utility): 检查 CSV 结构，保留正确列，重塑行数据，比较输出，并按需要拆分最终文件，支撑稳定导入或报表交付。
- [数据质量与异常调查工作流](https://elysiatools.com/zh/hubs/data-quality-anomaly-workflows): 对表格数据做质量剖析，识别重复、缺失、参照断裂、离群和值班时序异常，并把发现整理成可辩护的质量证据。
- [XLSX 多来源 ETL 导入与数仓交付](https://elysiatools.com/zh/hubs/xlsx-etl-ingestion-workflows): 把多个工作簿和 CSV 来源整理成可追溯、带 schema 依据的 SQL、Parquet 与对象存储批处理输入。
- [表格数据格式转换工作流](https://elysiatools.com/zh/hubs/csv-convert): 在 CSV、电子表格、JSON、HTML 表格、Markdown、XML 和文本之间转换，同时检查表头、分隔符、类型与编码。
