# Perfilador de calidad de datasets

Perfila datasets CSV o JSON para detectar faltantes, duplicados, drift de formato, tipos y outliers.

> Página canónica: https://elysiatools.com/es/tools/dataset-quality-profiler

- **Categoría:** Data Analysis

- **Palabras clave:** calidad de datos, csv, json, faltantes, anomalias

## Descripción general

Pegue un CSV en "Entrada de dataset" o suba un archivo CSV/JSON. El perfilador revisa cada columna y entrega una vista rapida de calidad antes de pasar el dato a BI, ETL o ML.

Que revisa:
- Valores faltantes por columna
- Filas duplicadas o combinaciones duplicadas segun las columnas indicadas en "Columnas para duplicados"
- Inferencia de tipos: number, boolean, date, string o empty
- Outliers numericos con una regla tipo IQR
- Drift de formato en columnas de texto/fecha, como fechas mezcladas o codigos mezclados con texto libre

Como llenar los campos:
- Entrada de dataset: pega texto CSV para un perfil rapido
- Archivo de datos: sube CSV o JSON si el dataset es mas grande o ya esta guardado
- Columnas para duplicados: opciona; usa claves separadas por comas como id,email para detectar duplicados por clave de negocio
- Filas de muestra: controla cuantas filas ejemplo se muestran en el reporte

Como leer el reporte:
- Quality score es un resumen 0-100; mas faltantes, duplicados y senales anomalias reducen el puntaje
- Missing indica cuantas celdas vacias/null hay en la columna
- Distinct muestra cuantas variantes unicas aparecen
- Anomalies resalta outliers numericos
- Format drift marca columnas con valores estructuralmente inconsistentes

Alcance actual:
- Soporta CSV y JSON
- JSON debe ser un arreglo de objetos o un objeto con un arreglo rows
- El puntaje es una senal operativa rapida, no una nota formal de gobierno de datos

## Entradas

- **Entrada de dataset** (textarea): id,name,amount 1,Alice,120 2,Bob, 3,Alice,9999
- **Archivo de datos** (file)
- **Columnas para duplicados** (text): id,email
- **Filas de muestra** (number)

## Cuándo usarlo

- Antes de cargar un nuevo conjunto de datos en un dashboard de Business Intelligence para evitar métricas erróneas.
- Al recibir archivos CSV o JSON de proveedores externos para validar su estructura y completitud.
- Durante la fase de preparación de datos en proyectos de Machine Learning para detectar valores atípicos (outliers) y ruido.

## Cómo funciona

- Pegue el texto de su dataset en formato CSV o suba directamente un archivo CSV o JSON desde su equipo.
- Opcionalmente, defina las 'Columnas para duplicados' (como id o email) para identificar registros repetidos según sus claves de negocio.
- Ajuste el número de 'Filas de muestra' que desea visualizar y ejecute el análisis.
- Revise el reporte HTML generado, que incluye una puntuación general de calidad, recuento de valores nulos, detección de anomalías y alertas de drift de formato por cada columna.

## Casos de uso

- Auditoría rápida de bases de datos de clientes para identificar correos electrónicos faltantes o IDs duplicados.
- Validación de reportes de ventas mensuales en CSV para asegurar que no haya valores numéricos atípicos antes de consolidar los ingresos.
- Revisión de logs exportados en JSON para detectar inconsistencias en los formatos de fecha y hora.

## Preguntas frecuentes

### ¿Qué formatos de archivo soporta el perfilador?

La herramienta soporta texto plano en formato CSV y archivos subidos con extensión .csv o .json. Los archivos JSON deben ser un arreglo de objetos o contener un arreglo llamado 'rows'.

### ¿Cómo calcula la herramienta los valores atípicos (outliers)?

Utiliza una regla estadística basada en el rango intercuartílico (IQR) para detectar y resaltar anomalías numéricas en las columnas correspondientes.

### ¿Qué significa el 'Quality score' en el reporte?

Es una métrica operativa de 0 a 100. Disminuye a medida que la herramienta encuentra más celdas vacías, filas duplicadas o señales de anomalías en el dataset.

### ¿Para qué sirve el campo 'Columnas para duplicados'?

Permite especificar claves de negocio separadas por comas (por ejemplo, 'id,email'). Si se llena, la herramienta buscará duplicados basados solo en esas columnas en lugar de comparar la fila completa.

### ¿Qué es el 'Format drift' o desviación de formato?

Es una alerta que se activa cuando los valores de una columna de texto o fecha son estructuralmente inconsistentes, como mezclar distintos formatos de fecha o combinar códigos con texto libre.

## Herramientas relacionadas

- [Analizador de logs estructurados](https://elysiatools.com/es/tools/structured-log-analyzer): Detecta formatos comunes de logs, extrae campos clave e infiere tipos para exportar en JSON, CSV o SQL.
- [Detector de desbalance y remuestreo](https://elysiatools.com/es/tools/dataset-imbalance-detector-resampler): Detecta desbalance de clases en datasets CSV o JSON, compara estrategias y previsualiza una salida balanceada
- [Detector de anomalias en series temporales](https://elysiatools.com/es/tools/time-series-anomaly-detector): Sube datos de series temporales en CSV o JSON, detecta anomalías con Z-Score e IQR y devuelve un informe con grafico
- [Analizador de pronostico y estacionalidad](https://elysiatools.com/es/tools/time-series-forecast-seasonality-analyzer): Pronostica periodos futuros desde series temporales CSV o JSON y muestra tendencia, componente estacional y residual
- [Divisor train/test con estratificación](https://elysiatools.com/es/tools/train-test-split-with-stratification): Lee un dataset CSV/JSON y divide en train/validation/test con muestreo estratificado por la columna objetivo (70/15/15 por defecto, semilla reproducible), o valida con k-fold estratificado; incluye informe de distribución de clases por split con barras de desviación, comprobación de fugas por filas duplicadas, vista previa de SMOTE (interpolación de vecinos sobre el split de train) y exportación de los CSV en ZIP.
- [Planificador de migracion CSV a base de datos](https://elysiatools.com/es/tools/csv-to-database-migration-planner): Infiere un schema relacional desde CSV y genera planes CREATE TABLE y ALTER para PostgreSQL, MySQL, SQLite o SQL Server
- [Visualizador de rutas JSON](https://elysiatools.com/es/tools/json-path-visualizer): Visualiza JSON o JSONL como un arbol expandible y copia expresiones JSONPath para cada nodo
- [Marcador de datos CSV/JSON](https://elysiatools.com/es/tools/csv-json-data-watermarker): Inyecta marcas visibles o firmadas en exportaciones CSV o JSON para rastrear datos compartidos

## Ejemplos

- [Ejemplos CSV](https://elysiatools.com/es/samples/csv-samples): Archivos CSV de muestra con varios tipos de datos, tamaños y niveles de complejidad
- [Ejemplos Python](https://elysiatools.com/es/samples/python): Ejemplos de código Python y demostraciones Hello World
- [Muestras JWT](https://elysiatools.com/es/samples/jwt-samples): Ejemplos completos de JWT desde la estructura básica de tokens hasta implementaciones de seguridad avanzadas
- [Ejemplos de Apache Arrow](https://elysiatools.com/es/samples/arrow): Ejemplos de formato columnar en memoria Apache Arrow para procesamiento de datos y análisis de alto rendimiento

## Contenido relacionado

- [Herramientas de formato, diff y normalización de JSON](https://elysiatools.com/es/hubs/json-format): Compara herramientas de formato JSON, diff, revisión de logs, comparación de configuración y normalización de datos en un solo hub para flujos de revisión de JSON.
- [Herramientas de calidad de datos, deduplicacion y deteccion de anomalías](https://elysiatools.com/es/hubs/data-quality-anomaly-workflows): Perfila datasets CSV/JSON, compara versiones de hojas de calculo y detecta duplicados, valores atipicos, faltantes, rupturas relacionales y anomalias temporales en un solo hub de calidad de datos.
- [Herramientas de redacción, resaltado y formato de presentación de texto](https://elysiatools.com/es/hubs/text-format): Compara herramientas para enmascarar texto sensible, detectar PII, normalizar teléfonos, resaltar frases, centrar texto y formatear diffs en un solo hub.
- [Herramientas de intercambio JSON y traduccion de formatos](https://elysiatools.com/es/hubs/json-convert): Compara herramientas de conversion JSON para CSV, YAML, TOML, GraphQL, XML, Markdown, Excel, BSON, EDN y otros formatos estructurados en un solo hub.
