# Perfilador de qualidade de datasets

Gera um perfil de qualidade para CSV ou JSON com faltantes, duplicados, drift de formato, tipos e outliers.

> Página canônica: https://elysiatools.com/pt/tools/dataset-quality-profiler

- **Categoria:** Data Analysis

- **Palavras-chave:** qualidade de dados, csv, json, faltantes, anomalias

## Visão geral

Cole um CSV em "Entrada do dataset" ou envie um arquivo CSV/JSON. O profiler inspeciona cada coluna e entrega uma visao rapida de qualidade antes de BI, ETL ou ML.

O que e verificado:
- Valores faltantes por coluna
- Linhas duplicadas ou combinacoes duplicadas com base nas colunas informadas em "Colunas para duplicados"
- Inferencia de tipo da coluna: number, boolean, date, string ou empty
- Outliers numericos usando uma regra no estilo IQR
- Drift de formato em colunas de texto/data, como datas misturadas ou codigos junto com texto livre

Como preencher os campos:
- Entrada do dataset: cole CSV diretamente para um perfil rapido
- Arquivo de dados: envie CSV ou JSON se o dataset for maior ou ja estiver salvo
- Colunas para duplicados: opcional; informe chaves separadas por virgula como id,email para detectar duplicados por chave de negocio
- Linhas de amostra: controla quantas linhas exemplo aparecem no relatorio

Como ler o relatorio:
- Quality score e um resumo rapido de 0 a 100; mais faltantes, duplicados e sinais anomalos reduzem a pontuacao
- Missing mostra quantas celulas vazias/null foram encontradas na coluna
- Distinct mostra quantos valores unicos aparecem
- Anomalies destaca outliers numericos
- Format drift marca colunas com valores estruturalmente inconsistentes

Escopo atual:
- CSV e JSON sao suportados
- JSON deve ser um array de objetos ou um objeto com array rows
- A pontuacao serve como sinal operacional rapido, nao como nota formal de governanca de dados

## Entradas

- **Entrada do dataset** (textarea): id,name,amount 1,Alice,120 2,Bob, 3,Alice,9999
- **Arquivo de dados** (file)
- **Colunas para duplicados** (text): id,email
- **Linhas de amostra** (number)

## Quando usar

- Antes de importar dados brutos para um banco de dados ou ferramenta de Business Intelligence (BI).
- Ao receber arquivos CSV ou JSON de terceiros para validar a integridade e a estrutura das informações.
- Durante a preparação de dados para modelos de Machine Learning, garantindo a ausência de outliers e valores nulos.

## Como funciona

- Cole o conteúdo do seu CSV no campo de texto ou faça o upload de um arquivo de dados nos formatos CSV ou JSON.
- Opcionalmente, defina colunas específicas (como 'id' ou 'email') para verificar duplicatas baseadas em chaves de negócio.
- Ajuste o número de linhas de amostra que deseja visualizar no relatório final.
- A ferramenta processa os dados e gera um relatório HTML detalhado com a pontuação de qualidade, tipos inferidos e anomalias detectadas.

## Casos de uso

- Auditoria rápida de bases de clientes para encontrar e-mails duplicados ou dados de contato em branco.
- Validação de relatórios financeiros mensais em CSV para detectar valores atípicos (outliers) antes da consolidação.
- Inspeção de logs de eventos em JSON para garantir que os formatos de data e os tipos de dados estejam consistentes.

## Perguntas frequentes

### Quais formatos de arquivo são suportados?

A ferramenta suporta arquivos CSV e JSON. Para JSON, o arquivo deve ser um array de objetos ou um objeto contendo um array chamado 'rows'.

### Como a pontuação de qualidade (Quality Score) é calculada?

A pontuação varia de 0 a 100. Ela é reduzida com base na quantidade de células vazias, linhas duplicadas, anomalias numéricas e inconsistências de formato encontradas no dataset.

### Posso verificar duplicatas usando apenas algumas colunas?

Sim. No campo 'Colunas para duplicados', você pode informar chaves separadas por vírgula (ex: id,email) para focar apenas nessas colunas em vez de comparar a linha inteira.

### O que significa 'Format drift' no relatório?

Indica colunas onde os valores parecem estruturalmente inconsistentes, como a mistura de diferentes formatos de data ou códigos misturados com texto livre.

### Como as anomalias numéricas são detectadas?

A ferramenta utiliza uma regra baseada no intervalo interquartil (estilo IQR) para identificar e destacar valores atípicos (outliers) em colunas numéricas.

## Ferramentas relacionadas

- [Analisador de logs estruturados](https://elysiatools.com/pt/tools/structured-log-analyzer): Detecta formatos comuns de logs, extrai campos principais e exporta em JSON, CSV ou SQL.
- [Detector de desbalanceamento e reamostragem](https://elysiatools.com/pt/tools/dataset-imbalance-detector-resampler): Detecta desbalanceamento de classes em datasets CSV ou JSON, compara estrategias e previsualiza uma saida balanceada
- [Detector de anomalias em series temporais](https://elysiatools.com/pt/tools/time-series-anomaly-detector): Envia dados de serie temporal em CSV ou JSON, detecta anomalias com Z-Score e IQR e retorna um relatorio com grafico
- [Analisador de previsao e sazonalidade](https://elysiatools.com/pt/tools/time-series-forecast-seasonality-analyzer): Projeta periodos futuros a partir de series temporais CSV ou JSON e mostra tendencia, sazonalidade e residuo
- [Divisor train/test com estratificação](https://elysiatools.com/pt/tools/train-test-split-with-stratification): Lê um dataset CSV/JSON e divide em train/validation/test com amostragem estratificada pela coluna alvo (70/15/15 padrão, semente reprodutível), ou k-fold estratificado; relatório de distribuição de classes por split com barras de desvio, checagem de vazamento por linhas duplicadas, prévia de SMOTE (interpolação de vizinhos no treino) e exportação dos CSV em ZIP.
- [Planejador de migracao CSV para banco de dados](https://elysiatools.com/pt/tools/csv-to-database-migration-planner): Infere um schema relacional a partir de CSV e gera planos CREATE TABLE e ALTER para PostgreSQL, MySQL, SQLite ou SQL Server
- [Visualizador de caminhos JSON](https://elysiatools.com/pt/tools/json-path-visualizer): Visualiza JSON ou JSONL como uma arvore expansivel e permite copiar expressoes JSONPath para cada no
- [Marcador de dados CSV/JSON](https://elysiatools.com/pt/tools/csv-json-data-watermarker): Injeta campos de marca visivel ou assinatura em exportacoes CSV ou JSON para rastrear compartilhamentos

## Exemplos

- [Exemplos CSV](https://elysiatools.com/pt/samples/csv-samples): Arquivos CSV de exemplo com vários tipos de dados, tamanhos e níveis de complexidade
- [Exemplos Python](https://elysiatools.com/pt/samples/python): Exemplos de código Python e demonstrações Hello World
- [Exemplos JWT](https://elysiatools.com/pt/samples/jwt-samples): Exemplos completos de JWT da estrutura básica de tokens às implementações de segurança avançadas
- [Exemplos Apache Arrow](https://elysiatools.com/pt/samples/arrow): Exemplos de formato colunar em memória Apache Arrow para processamento de dados e análise de alta performance

## Conteúdo relacionado

- [Ferramentas de formatação, diff e normalização de JSON](https://elysiatools.com/pt/hubs/json-format): Compare ferramentas de formatação JSON, diff, revisão de logs, comparação de configuração e normalização de dados em um único hub para fluxos de revisão de JSON.
- [Ferramentas de qualidade de dados, deduplicacao e deteccao de anomalias](https://elysiatools.com/pt/hubs/data-quality-anomaly-workflows): Perfilhe datasets CSV/JSON, compare versoes de planilhas e encontre duplicatas, outliers, faltas de dados, quebras relacionais e anomalias de series temporais em um unico hub.
- [Ferramentas de redação, destaque e formatação de apresentação de texto](https://elysiatools.com/pt/hubs/text-format): Compare ferramentas para mascarar texto sensível, detectar PII, normalizar telefones, destacar frases, centralizar texto e formatar diffs em um único hub.
- [Ferramentas de intercambio JSON e traducao de formatos](https://elysiatools.com/pt/hubs/json-convert): Compare ferramentas de conversao JSON para CSV, YAML, TOML, GraphQL, XML, Markdown, Excel, BSON, EDN e outros formatos estruturados em um unico hub.
