# 数据质量画像师

对 CSV 或 JSON 数据集进行质量画像，识别缺失值、重复行、格式漂移、类型推断和数值异常。

> 标准页面: https://elysiatools.com/zh/tools/dataset-quality-profiler

- **分类:** Data Analysis

- **关键词:** 数据质量, csv, json, 缺失值, 异常值

## 概述

把 CSV 粘贴到“数据集输入”中，或直接上传 CSV/JSON 文件。这个工具会逐列检查，给你一个在进入 BI、ETL 或机器学习前的快速质量快照。

会检查什么：
- 每列的缺失值
- 重复行，或者基于“重复判定列”指定业务键的重复组合
- 列类型推断：number、boolean、date、string 或 empty
- 使用 IQR 风格规则识别数值异常值
- 字符串/日期列的格式漂移，比如日期格式混用、编码字段和自由文本混杂

字段怎么填：
- 数据集输入：适合直接粘贴 CSV 文本做快速分析
- 数据文件：当数据更大或已经保存在本地时可直接上传 CSV/JSON
- 重复判定列：可选，填写逗号分隔列名，例如 id,email，用业务键而不是整行来判定重复
- 示例行数：控制报告里展示多少行样例数据

怎么看结果：
- 质量评分是 0-100 的快速总结，缺失值、重复行和异常信号越多，分数越低
- Missing 表示该列发现了多少空白/null 单元格
- Distinct 表示该列有多少不同取值
- Anomalies 主要表示数值异常值
- Format drift 表示这一列里的值在结构上看起来不一致

当前范围：
- 支持 CSV 和 JSON
- JSON 需要是对象数组，或者包含 rows 数组的对象
- 这个分数更适合做快速运营判断，不是严格的数据治理评级

## 输入项

- **数据集输入** (textarea): id,name,amount 1,Alice,120 2,Bob, 3,Alice,9999
- **数据文件** (file)
- **重复判定列** (text): id,email
- **示例行数** (number)

## 适用场景

- 在将外部获取的 CSV 或 JSON 数据源导入数据库或数据仓库前，进行快速的质量摸底。
- 准备进行机器学习模型训练或 BI 报表制作时，排查数据集中存在的缺失值和异常数值。
- 需要快速定位业务数据中的重复记录（如重复的用户 ID 或订单号）以及字段格式不一致的问题。

## 工作原理

- 在“数据集输入”框中直接粘贴 CSV 文本，或通过“数据文件”上传本地的 CSV 或 JSON 文件。
- （可选）在“重复判定列”中输入业务主键（如 id,email），工具将基于这些指定列而不是整行来判定重复项。
- 设置“示例行数”以控制报告中展示的数据样例数量，然后提交分析。
- 查看生成的 HTML 质量报告，获取 0-100 的整体质量评分，并逐列检查缺失率、唯一值、数值异常（基于 IQR 规则）和格式漂移情况。

## 使用案例

- 数据工程师在构建 ETL 管道前，对上游提供的原始业务数据进行质量探查。
- 数据分析师在制作 BI 销售看板前，检查交易记录中的缺失字段和异常金额。
- 运营人员在合并多渠道的用户名单时，通过指定邮箱或手机号列来排查重复用户。

## 常见问题

### 支持哪些格式的数据文件？

目前支持 CSV 文本粘贴，以及上传 CSV 和 JSON 格式的文件。JSON 文件需要是对象数组，或者包含 rows 数组的对象。

### 质量评分（Quality Score）是如何计算的？

质量评分是一个 0-100 的快速参考值。数据集中包含的缺失值、重复行、格式漂移和异常数值越多，该评分就会越低。它适合作为快速的运营判断依据，而非严格的数据治理评级。

### 如何只针对特定列检查重复项？

您可以在“重复判定列”中填写逗号分隔的列名（例如 id,email）。工具将仅根据这些业务键的组合来判断是否存在重复记录，而不是比对整行数据。

### 报告中的“Format drift（格式漂移）”是什么意思？

格式漂移表示同一列中的数据在结构或格式上存在不一致。例如，日期列中混用了不同的日期格式，或者文本列中混杂了纯数字编码和自由文本。

### 这个工具会自动清洗或修改我的数据吗？

不会。该工具仅用于数据质量画像和分析，生成只读的 HTML 质量报告，不会对您的原始数据进行任何修改或清洗操作。

## 相关工具

- [结构化日志解析器](https://elysiatools.com/zh/tools/structured-log-analyzer): 自动识别常见日志格式，提取核心字段并推断字段类型，支持导出为 JSON、CSV 或 SQL。
- [数据集不平衡检测与重采样](https://elysiatools.com/zh/tools/dataset-imbalance-detector-resampler): 检测 CSV 或 JSON 数据集中的类别不平衡，对比重采样策略，并预览平衡后的输出数据集
- [时间序列异常检测器](https://elysiatools.com/zh/tools/time-series-anomaly-detector): 上传 CSV 或 JSON 时间序列数据，基于 Z-Score 和 IQR 检测异常点，并输出带图表的报告
- [时间序列预测与季节性分析](https://elysiatools.com/zh/tools/time-series-forecast-seasonality-analyzer): 从 CSV 或 JSON 时间序列数据中预测未来数期，并在一份报告中查看趋势、季节项和残差分解
- [训练/测试集分层切分器](https://elysiatools.com/zh/tools/train-test-split-with-stratification): 读取 CSV/JSON 数据集,按目标列做分层抽样的 train/validation/test 切分(默认 70/15/15,随机种子可复现),或分层 k 折交叉验证;输出每折类别分布报告与偏差条、重复行泄漏检查、SMOTE 过采样预览(仅在训练折上做最近邻插值),并可导出各折 CSV 为 ZIP。
- [CSV 转数据库迁移规划器](https://elysiatools.com/zh/tools/csv-to-database-migration-planner): 根据 CSV 数据推断关系型 schema，并为 PostgreSQL、MySQL、SQLite 或 SQL Server 生成建表和 ALTER 迁移计划
- [JSON 路径可视化器](https://elysiatools.com/zh/tools/json-path-visualizer): 将 JSON 或 JSONL 以可展开树形结构展示，并为每个节点生成可复制的 JSONPath 表达式
- [CSV/JSON 数据水印器](https://elysiatools.com/zh/tools/csv-json-data-watermarker): 为 CSV 或 JSON 导出注入可见或签名式水印字段，以便后续追踪共享数据

## 示例

- [CSV示例](https://elysiatools.com/zh/samples/csv-samples): 各种数据类型、大小和复杂度级别的CSV示例文件
- [Python 示例](https://elysiatools.com/zh/samples/python): Python代码示例和Hello World演示
- [JWT 示例](https://elysiatools.com/zh/samples/jwt-samples): 从基础令牌结构到高级安全实现的全面JWT示例
- [Apache Arrow 示例](https://elysiatools.com/zh/samples/arrow): Apache Arrow 内存列式格式示例，用于高性能数据处理和分析

## 相关内容

- [JSON 格式化、对比与规范化工具](https://elysiatools.com/zh/hubs/json-format): 在一个专题中比较 JSON 格式化、差异对比、日志审查、配置比较和数据规范化工具，适合需要让 JSON 更易读、更易审查的流程。
- [数据质量、去重与异常检测工具](https://elysiatools.com/zh/hubs/data-quality-anomaly-workflows): 在一个数据质量工作流专题里检查 CSV/JSON 数据集，比较表格版本，发现重复、离群值、缺失值问题、关联断裂和时序异常。
- [文本脱敏、高亮与展示格式化工具](https://elysiatools.com/zh/hubs/text-format): 在一个专题中比较文本脱敏、PII 检测、电话号码规范化、重点高亮、居中排版和 diff 格式化工具。
- [JSON 交换与格式翻译工具](https://elysiatools.com/zh/hubs/json-convert): 在一个专题里比较 JSON 与 CSV、YAML、TOML、GraphQL、XML、Markdown、Excel、BSON、EDN 等结构化格式之间的转换工具。
