离群值移除、替换还是标记?
移除保住统计纯度但丢样本;用中位数或上限替换保住每一行、软化两端尾巴;标记保留一切、把裁决交给下游——按分析对极端值的依赖程度来选。
Elysia Tools
导航
Workflow Playbook
把杂乱的表格数据做成可分析的——合并各源表为一张、剥掉破坏列匹配的 BOM 字符、只留要用的列、修拼写统一格式、按既定策略而非慌乱处理离群值、缩放或标准化数值,最后做范围限幅并给出交叉汇总表。
专题
数据准备最常见的失败方式,是按两套标准做了两遍。两份源导出各自清洗,各自长出一种日期格式、一种类别拼法,合并时旧伤全部重开。这里的顺序防的就是这件事——先合并,列匹配对全部源一次做完;再清洗,对整张表一次做完;此后每一步都是单张表上的单一策略。前提是对要紧的列诚实:先收窄再动手,出错的面就小一半。
两类隐形故障贡献了大多数静默的准备事故。字节顺序标记蹲在第一列列名前面,看起来什么都没有,却弄坏对它的每一次精确匹配——join 返回零行而不报错,是它的签名。重复行是第二个:在所有字段上都一致的两行是同一事实被数了两次,任何建立在它们之上的合计都恰好多说了那么多。两个陷阱拆除都便宜——剥标记、去重复——而在下游发现都昂贵,所以它们排在一切聪明操作之前。
离群值不是脏东西,它是一个立场强烈的数据点——我是故障,或者我是你专程来研究的事件。移除它是有统计后果的领域判断,所以本工作流把决定逼到明处:每列一条明说的策略,执行并计数。想让尾巴软化又保住行,就替换成中位数或上限;想让下游分析自己投票,就标记;值被证明是错的,才移除。策略是什么要写进记录,因为一个说不清自己如何对待极端值的结果,也辩护不了自己。
Min-Max 与 Z-score 不是可以随手互换的习惯。Min-Max 把一切框进 0 到 1、保住形状——下游要的是有界输入时很好,一个极端值把其余全部压向零时很脆。Z-score 让各列以零为中心、单位方差,对重尾耸耸肩——以标准差度量的方法正合适。检验是算术的,不是看图的:Min-Max 列必须恰好横跨 0 到 1,标准化列必须均值 0、标准差 1;用了哪种方法要记录在案,留给重跑这份工作的人。
本页止于一张干净、整形、缩放好的工作表和它的交叉汇总。周围是各管一段的邻居——从非结构化文本里拉出结构是文本表格提取工作流的事,对单个 CSV 做行列手术是 CSV 工具工作流的事,为数据集做质量异常审计是数据质量工作流的事,把成品表搬进工作簿或别的格式归摄取与转换工作流管。数据在这里整形,然后交给拥有下一环节的那个阶段。
工作流指南
用智能列匹配垂直追加各源表,让同类列落在一起;剥掉让第一列列名无法匹配的字节顺序标记。
只抽取分析会用到的列,然后在一次有意的处理里修拼写错误、统一格式、去除重复。
检出极端值,按既定策略移除、替换或标记——写下做了什么、动了多少行。
下游方法要有界 0 到 1 区间时用 Min-Max 归一化,要居中单位方差列时用 Z-score 标准化——每张表一种选择,写在纸上。
用截断、过滤或标记把数值限制在合法范围内,再生成交叉表,把长条工作表变成分析真正要读的汇总。
移除保住统计纯度但丢样本;用中位数或上限替换保住每一行、软化两端尾巴;标记保留一切、把裁决交给下游——按分析对极端值的依赖程度来选。
Min-Max 把数值压进固定的 0 到 1 区间、保形状,但一个极端值能把其余全部挤进角落;Z-score 以零为中心、单位方差,扛得住重尾——按下游方法的假设选,并记下跑的是哪一种。
截断把掉队者拉回合法区间、保住每一行;过滤删掉违规的行;标记既留值又留判决——越界值意味着坏读数还是坏传感器,决定哪种做法正确。