# Профилировщик качества датасетов

Строит профиль качества CSV или JSON, выявляя пропуски, дубли, дрейф форматов и выбросы.

> Каноническая страница: https://elysiatools.com/ru/tools/dataset-quality-profiler

- **Категория:** Data Analysis

- **Ключевые слова:** качество данных, csv, json, пропуски, аномалии

## Обзор

Вставьте CSV в поле "Ввод датасета" или загрузите CSV/JSON-файл. Профилировщик проверяет каждую колонку и дает быстрый снимок качества до передачи данных в BI, ETL или ML.

Что проверяется:
- Пропуски по каждой колонке
- Дубли строк или дубли по комбинации колонок из поля "Колонки для дублей"
- Определение типа колонки: number, boolean, date, string или empty
- Числовые выбросы по правилу, похожему на IQR
- Дрейф формата в строковых и датовых колонках, например смешанные форматы дат или коды вперемешку со свободным текстом

Как заполнять поля:
- Ввод датасета: вставьте CSV-текст для быстрого анализа
- Файл данных: загрузите CSV или JSON, если набор больше или уже сохранен локально
- Колонки для дублей: необязательно; укажите столбцы через запятую, например id,email, чтобы искать дубли по бизнес-ключу
- Строк для примера: задает число строк, показываемых в предпросмотре отчета

Как читать отчет:
- Quality score — это быстрый итог 0-100; чем больше пропусков, дублей и аномалий, тем ниже балл
- Missing показывает количество пустых/null ячеек в колонке
- Distinct показывает количество уникальных значений
- Anomalies выделяет числовые выбросы
- Format drift показывает колонки, где значения структурно неоднородны

Текущие границы:
- Поддерживаются CSV и JSON
- JSON должен быть массивом объектов или объектом с массивом rows
- Этот балл предназначен для быстрого операционного сигнала, а не для формальной оценки data governance

## Входные данные

- **Ввод датасета** (textarea): id,name,amount 1,Alice,120 2,Bob, 3,Alice,9999
- **Файл данных** (file)
- **Колонки для дублей** (text): id,email
- **Строк для примера** (number)

## Когда использовать

- Перед импортом сырых данных в хранилище или BI-инструмент для предотвращения ошибок загрузки и искажения метрик.
- При получении нового датасета от стороннего поставщика для быстрой оценки его полноты, структуры и консистентности.
- На этапе подготовки данных для машинного обучения, чтобы выявить аномалии, пустые значения и несоответствия типов в признаках.

## Как это работает

- Вставьте текст в формате CSV в поле ввода или загрузите готовый CSV/JSON файл с вашего устройства.
- При необходимости укажите через запятую названия колонок (например, id,email) для поиска дубликатов по конкретным бизнес-ключам.
- Задайте количество строк для предпросмотра (от 3 до 20) и запустите анализ.
- Изучите сгенерированный HTML-отчет, где указаны общий балл качества, количество пропусков, уникальных значений, выбросов и дрейф форматов по каждому столбцу.

## Сценарии использования

- Проверка выгрузки транзакций из CRM-системы на наличие дублирующихся ID клиентов и пустых email-адресов.
- Анализ логов событий в формате JSON для выявления сбоев в форматах дат и времени перед парсингом.
- Оценка качества набора данных о продажах для выявления аномальных сумм чеков (выбросов) перед построением дашборда.

## Частые вопросы

### Какие форматы файлов поддерживает инструмент?

Инструмент поддерживает текстовый ввод CSV, а также загрузку файлов в форматах CSV и JSON. JSON должен представлять собой массив объектов или объект с массивом rows.

### Как работает поиск дубликатов?

По умолчанию инструмент ищет полные дубликаты строк. Если заполнить поле «Колонки для дублей» (например, id,email), он найдет строки с одинаковыми значениями только в указанных столбцах.

### Что такое дрейф формата (Format drift)?

Это ситуация, когда значения в одной колонке структурно неоднородны. Например, когда в столбце с датами используются разные форматы записи или текст смешан с числовыми кодами.

### Как рассчитывается Quality score?

Это балл от 0 до 100, который служит быстрым операционным индикатором. Чем больше в датасете пропущенных значений, дубликатов и аномалий, тем ниже итоговая оценка.

### Как определяются числовые выбросы (Anomalies)?

Инструмент использует правило, похожее на межквартильный размах (IQR), для выявления аномально больших или маленьких числовых значений в колонках.

## Связанные инструменты

- [Анализатор структурированных логов](https://elysiatools.com/ru/tools/structured-log-analyzer): Определяет распространенные форматы логов, извлекает ключевые поля и выводит JSON, CSV или SQL.
- [Детектор дисбаланса датасета и ресемплер](https://elysiatools.com/ru/tools/dataset-imbalance-detector-resampler): Выявляет дисбаланс классов в CSV или JSON, сравнивает стратегии ресемплинга и показывает сбалансированный набор
- [Детектор аномалий временных рядов](https://elysiatools.com/ru/tools/time-series-anomaly-detector): Загружает временной ряд в CSV или JSON, находит аномалии по Z-Score и IQR и возвращает отчет с графиком
- [Анализатор прогноза и сезонности](https://elysiatools.com/ru/tools/time-series-forecast-seasonality-analyzer): Строит прогноз по CSV или JSON временным рядам и показывает тренд, сезонность и остатки в одном отчете
- [Разделение train/test со стратификацией](https://elysiatools.com/ru/tools/train-test-split-with-stratification): Читает датасет CSV/JSON и делит на train/validation/test со стратификацией по целевому столбцу (по умолчанию 70/15/15, воспроизводимое зерно) или стратифицированный k-fold; отчёт о распределении классов по сплитам с полосами отклонения, проверка утечек через дубликаты строк, предпросмотр SMOTE (интерполяция ближайших соседей на train) и экспорт CSV в ZIP.
- [Планировщик миграции CSV в базу данных](https://elysiatools.com/ru/tools/csv-to-database-migration-planner): Выводит реляционную схему из CSV и генерирует CREATE TABLE и ALTER для PostgreSQL, MySQL, SQLite или SQL Server
- [Визуализатор JSON Path](https://elysiatools.com/ru/tools/json-path-visualizer): Показывает JSON или JSONL в виде раскрывающегося дерева и позволяет копировать JSONPath для каждого узла
- [Водяные знаки для CSV/JSON данных](https://elysiatools.com/ru/tools/csv-json-data-watermarker): Встраивает видимые или сигнатурные поля в CSV/JSON-экспорт для последующего отслеживания

## Примеры

- [CSV Примеры](https://elysiatools.com/ru/samples/csv-samples): Примеры CSV-файлов с различными типами данных, размерами и уровнями сложности
- [Примеры Python](https://elysiatools.com/ru/samples/python): Примеры кода Python и демонстрации Hello World
- [Примеры JWT](https://elysiatools.com/ru/samples/jwt-samples): Полные примеры JWT от базовой структуры токенов до продвинутых реализаций безопасности
- [Примеры Apache Arrow](https://elysiatools.com/ru/samples/arrow): Примеры формата в памяти Apache Arrow для высокопроизводительной обработки данных и аналитики

## Связанные материалы

- [Инструменты форматирования, diff и нормализации JSON](https://elysiatools.com/ru/hubs/json-format): Сравните инструменты форматирования JSON, diff, анализа логов, сравнения конфигураций и нормализации данных в одном хабе для удобной проверки JSON.
- [Инструменты качества данных, дедупликации и поиска аномалий](https://elysiatools.com/ru/hubs/data-quality-anomaly-workflows): Профилируйте CSV/JSON-наборы данных, сравнивайте версии таблиц и находите дубликаты, выбросы, пропуски, разрывы связей и аномалии временных рядов в одном тематическом hub.
- [Инструменты маскирования, подсветки и форматирования текста](https://elysiatools.com/ru/hubs/text-format): Сравните в одном хабе инструменты маскирования чувствительного текста, поиска PII, нормализации телефонов, подсветки фраз, центрирования текста и форматирования diff.
- [Инструменты JSON-обмена и перевода форматов](https://elysiatools.com/ru/hubs/json-convert): Сравните инструменты преобразования JSON для CSV, YAML, TOML, GraphQL, XML, Markdown, Excel, BSON, EDN и других структурированных форматов в одном хабе.
