# Limpeza, conformação e normalização de dados tabulares

Leve dados tabulares bagunçados ao ponto de análise — funda as tabelas de origem numa só, tire as marcas de ordem de byte que quebram o casamento de colunas, guarde só as colunas necessárias, corrija grafia e formatos, trate os outliers por política e não por pânico, escale ou padronize os números e termine com limites de faixa e uma tabela cruzada de resumo.

> Página canônica: https://elysiatools.com/pt/hubs/tabular-data-cleanup-and-normalization

- **Palavras-chave:** limpar dados tabulares, fundir tabelas de dados, remover BOM de CSV, extrair colunas de dados, detecção de outliers, normalização min-max, padronização z-score, limitar valores à faixa

## Perguntas frequentes

### O que é um BOM e por que ele quebra meus joins?

A marca de ordem de byte é um caractere invisível que alguns exportadores — o Excel entre eles — colam na frente de arquivos UTF-8. O nome da primeira coluna passa a carregar um prefixo fantasma, e o casamento exato com o mesmo nome escrito à mão falha em silêncio — o join devolve nada e nenhum erro aparece. Removê-la antes do casamento custa um passo.

### Por que fundir as tabelas antes de limpá-las?

Porque a deriva de formato se esconde entre tabelas — a mesma categoria grafada de três jeitos em três exportações é um problema quando te encontra numa tabela só, e três problemas quando você limpa cada exportação separadamente. Fundir primeiro e limpar uma vez significa que cada convenção é aplicada ao conjunto inteiro ao mesmo tempo.

### Deletar outliers é sempre o padrão seguro?

Não — deletar é um julgamento sobre o mundo, não uma regra de higiene. Um valor extremo pode ser um glitch de sensor que convém remover, ou o evento mais importante dos dados que convém guardar. Olhe a distribuição, pergunte o que o valor significa no domínio, e na dúvida marque em vez de deletar — a análise pode ignorar uma marca, mas não pode desfazer a deleção de uma linha.

### Modelos de árvore precisam mesmo de normalização?

A maioria não — árvores de decisão e seus conjuntos dividem por ordem, não por distância, então escalar não muda nada para eles. O passo ganha o sal com métodos de distância e gradiente — clustering, vizinhos mais próximos, regressão com regularização, redes neurais. Conheça seu consumidor antes de escalar.

## Conteúdo relacionado

- [Analise de texto semiestruturado e extracao de tabelas](https://elysiatools.com/pt/hubs/semi-structured-text-table-extraction): Transforme registros de largura fixa, texto delimitado irregular, logs e tabelas Markdown ou HTML em CSV, JSON, XML ou Excel com limpeza verificavel.
- [Fluxo de limpeza, reorganizacao e entrega de CSV](https://elysiatools.com/pt/hubs/csv-utility): Inspecione a estrutura CSV, mantenha as colunas corretas, reorganize linhas, compare resultados e divida os arquivos finais quando necessario.
- [Fluxos de qualidade de dados e investigacao de anomalias](https://elysiatools.com/pt/hubs/data-quality-anomaly-workflows): Perfilhe dados tabulares, isole duplicatas, faltas, quebras referenciais, outliers e anomalias temporais e transforme os achados em evidencia de qualidade.
- [Ingestão ETL de XLSX e entrega para o warehouse](https://elysiatools.com/pt/hubs/xlsx-etl-ingestion-workflows): Reúna várias pastas de trabalho e fontes CSV em artefatos rastreáveis para carga SQL, pipelines Parquet e lotes em armazenamento de objetos.
- [Fluxo de conversão de dados tabulares](https://elysiatools.com/pt/hubs/csv-convert): Converta CSV, planilhas, JSON, tabelas HTML, Markdown, XML e texto preservando cabeçalhos, delimitadores, tipos e codificação.
