# 数据清洗器

清洗和标准化数据，修复拼写错误、标准化格式、移除重复项和填充缺失值

> 标准页面: https://elysiatools.com/zh/tools/data-cleaner

- **分类:** Data Processing

- **关键词:** 数据, 清洗, 标准化, 格式, 拼写, 修复, 规范化, 重复, 缺失

## 概述

数据清洗器是一款高效的数据处理工具，旨在帮助用户快速修复拼写错误、统一数据格式、剔除重复记录并填充缺失值，从而确保数据集的准确性与一致性。

## 输入项

- **输入数据** (textarea): 输入要清洗的数据，每行一条记录...
- **输入格式** (select)
- **修复拼写错误** (checkbox)
- **标准化数据格式** (checkbox)
- **移除重复记录** (checkbox)
- **填充缺失值** (checkbox)
- **去除空白字符** (checkbox)
- **移除空记录** (checkbox)
- **自定义分隔符** (text): CSV/TSV/SSV格式的自定义分隔符
- **输出格式** (select)
- **文本大小写样式** (select)
- **日期格式标准化** (select)
- **数字格式标准化** (select)

## 适用场景

- 在处理从不同来源导出的混乱数据，需要统一格式时。
- 在进行数据分析前，需要剔除重复项并修复拼写错误以保证结果准确时。
- 在整理包含大量缺失值或格式不规范的原始文本列表时。

## 工作原理

- 将原始数据粘贴到输入框中，并选择对应的输入格式（如逐行、CSV 或 JSON）。
- 根据需求勾选清洗选项，包括修复拼写、标准化格式、移除重复项及填充缺失值。
- 配置文本大小写、日期或数字的标准化规则，点击执行即可获得清洗后的数据。
- 选择所需的输出格式（如格式化表格或 CSV），直接复制或下载处理后的结果。

## 使用案例

- 整理客户联系人列表，统一电话和地址格式并剔除重复联系人。
- 标准化财务报表中的日期和数字格式，以便导入到分析软件中。
- 清洗从网页抓取的原始文本数据，去除多余空格并修复常见的拼写错误。

## 常见问题

### 数据清洗器支持哪些输入格式？

支持逐行文本、CSV、TSV、SSV 以及 JSON 数组格式。

### 如何处理数据中的重复记录？

只需勾选“移除重复记录”选项，工具会自动识别并剔除完全相同的行。

### 可以自定义日期和数字的显示格式吗？

可以，通过日期格式标准化和数字格式标准化选项，您可以将数据统一转换为指定的格式。

### 清洗后的数据支持导出吗？

支持，您可以选择将结果以格式化表格、CSV、JSON 或简单列表的形式输出。

### 该工具会修改原始数据吗？

不会，工具仅在浏览器端处理您输入的数据，不会对您的原始文件或数据源进行任何修改。

## 相关工具

- [BOM字符移除器](https://elysiatools.com/zh/tools/data-bom-remover): 从文本和文件内容中移除BOM（字节顺序标记）字符。非常适合清理有编码问题的文本文件、修复CSV导入和为处理准备数据。 功能特点： - 检测并移除UTF-8 BOM (EF BB BF) - 检测并移除UTF-16 BOM (FE FF 或 FF FE) - 检测并移除UTF-32 BOM (00 00 FE FF 或 FF FE 00 00) - 支持多种输入格式 - 可视化BOM字符显示 - 详细检测报告 - 支持批量文本处理 常见用途： - 修复CSV文件导入错误 - 清理文本文件编码问题 - 为JSON解析准备数据 - 修复XML解析问题 - 解决API数据编码冲突 - 标准化文本数据格式
- [重复列移除器](https://elysiatools.com/zh/tools/duplicate-column-remover): 使用灵活的检测策略从CSV数据中移除重复列。非常适合清理数据集、移除冗余信息和优化数据结构。 功能特点： - 检测相同标题的列 - 查找相同数据内容的列 - 支持大小写敏感/不敏感匹配 - 多种移除策略可选 - 保持数据完整性 - 支持大型数据集 - 快速高效的处理 常见用途： - 清理合并的数据集 - 移除冗余数据列 - 优化分析数据 - 为机器学习准备数据 - 减少文件大小和复杂度 - 标准化数据格式
- [表头删除器](https://elysiatools.com/zh/tools/header-remover): 从CSV数据中删除表头，创建无表头的干净文件。非常适合数据库导入、数据处理管道、API集成和需要无表头CSV格式的系统。 功能特点： - 从CSV数据中删除第一行（表头） - 删除多个表头行 - 删除表头前跳过空行 - 保持数据完整性 - 支持多种CSV分隔符 - 删除前预览 - 数据验证选项 - 批量处理能力 常见用途： - 为数据库导入准备数据 - 清理API响应数据 - 从导出文件中移除元数据 - 为机器学习创建无表头数据 - 为不使用表头的系统准备数据 - 从结构化文件中提取纯数据值
- [CSV 行去重工具](https://elysiatools.com/zh/tools/csv-deduplicate-rows): 支持上传 CSV 或直接粘贴 CSV 文本，按精确或模糊规则去重，并导出清洗后的 CSV。
- [数据去重工具](https://elysiatools.com/zh/tools/data-deduplicator): 基于多列组合移除重复记录
- [数据范围限制器](https://elysiatools.com/zh/tools/data-range-limiter): 将数值限制在指定范围内，通过裁剪、过滤或标记越界值。完美用于数据质量控制、传感器数据清洗、业务规则执行和数据预处理。 功能特点： - 范围裁剪（将值裁剪到最小/最大边界） - 范围过滤（移除越界行） - 范围标记（标记修改的值） - 每列范围配置 - 自动数值列检测 - 多种处理策略 - 详细修改报告 - 变更统计分析 - 业务规则执行 常见用途： - 传感器数据验证和清洗 - 机器学习输入准备 - 数据质量控制和验证 - 业务约束执行 - 异常值管理和控制 - 数据预处理管道
- [Z-Score标准化工具](https://elysiatools.com/zh/tools/data-zscore-normalizer): 使用Z-Score（标准分数）标准化数值数据，使数据均值为0，标准差为1。完美用于统计分析、机器学习特征预处理、异常检测和不同尺度数据比较。 功能特点： - Z-Score标准化（均值=0，标准差=1） - 稳健Z-Score选项（使用中位数和MAD） - 自定义缩放到目标范围 - 多列选择 - 自动数据类型检测 - 智能处理缺失值 - 保留非数值列 - 综合统计摘要 - 异常值检测和报告 常见用途： - 机器学习特征准备 - 统计假设检验 - 异常值检测和移除 - 不同单位数据比较 - 主成分分析（PCA）预处理
- [边界值处理器](https://elysiatools.com/zh/tools/data-boundary-processor): 高级边界值处理工具，用于识别和处理数值数据中的最小值和最大值。完美适用于数据验证、范围检查、统计分析和数据预处理。 功能特点： - 多种边界检测方法（绝对值、百分位数、标准差） - 灵活处理策略（裁剪、删除、替换、变换） - 自定义范围验证 - 非对称边界处理 - 批量处理能力 - 综合边界统计 - 数据质量评估 - 可视化边界报告 常见用途： - 数据验证和质量控制 - 传感器数据范围检查 - 金融数据限制执行 - 统计数据预处理 - 机器学习特征工程 - 数据库约束验证

## 示例

- [重复行示例](https://elysiatools.com/zh/samples/text-duplicate-line-samples): 用于测试重复行移除工具的各种重复行类型的示例文件
- [正则替换示例](https://elysiatools.com/zh/samples/regex-replace): 用于文本转换和数据清洗的常用正则替换模式集合
- [Windows 字符串处理 - C# 示例](https://elysiatools.com/zh/samples/windows-string-processing-csharp): Windows平台C#字符串处理示例，包括字符串操作、分割、连接、正则表达式和文本分析
- [CSV示例](https://elysiatools.com/zh/samples/csv-samples): 各种数据类型、大小和复杂度级别的CSV示例文件
