Uma tabela de trabalho, depois um conjunto de regras
A preparação de dados falha com mais frequência por ser feita duas vezes com padrões diferentes. Duas exportações limpas separadamente cultivam dois formatos de data e duas grafias de categoria, e a fusão delas reabre cada ferida. A ordem daqui impede isso — fundir primeiro para que o casamento de colunas aconteça uma vez sobre todas as fontes, limpar uma vez sobre a tabela inteira, e cada passo seguinte aplicar uma política única a uma tabela única. O pré-requisito é honestidade sobre as colunas que importam — estreitar antes de trabalhar corta pela metade a superfície onde erros podem se criar.
As armadilhas que não se conseguem ver
Duas falhas invisíveis respondem pela maioria dos bugs silenciosos de preparação. A marca de ordem de byte senta na frente do nome da primeira coluna fingindo ser nada e quebrando cada casamento exato contra ele — sua assinatura é o join que devolve zero linhas sem erro. Duplicatas são a segunda — duas linhas que concordam em todos os campos são um fato contado duas vezes, e qualquer total construído sobre elas mente por exatamente isso. As duas armadilhas se desarmam barato — tirar a marca, deduplicar a tabela — e se descobrem caro rio abaixo, por isso vêm antes de qualquer coisa engenhosa.
Outliers são decisões, não manchas
Um outlier não é sujeira — é um dado com uma postura forte — sou um glitch, ou sou o evento que você veio estudar. Removê-lo é um julgamento de domínio com consequências estatísticas, então este fluxo obriga a decisão a sair à luz — uma política declarada por coluna, executada e contada. Substitua por mediana ou teto quando as caudas devam amaciar mas as linhas fiquem; marque quando a análise adiante merecer o voto; remova quando o valor for comprovadamente errado. A política vai para as anotações, porque um resultado que não sabe dizer como tratou seus extremos também não consegue se defender.
O escalonamento segue o consumidor
Min-Max e Z-score não são hábitos intercambiáveis. Min-Max encaixa tudo numa faixa de 0 a 1 e preserva a forma — bom quando o método adiante quer entradas delimitadas, frágil quando um extremo esmaga o resto contra o zero. O Z-score centra as colunas em zero com variância unitária e dá de ombros a caudas pesadas — certo para métodos que medem em desvios padrão. O teste é aritmético, não visual — uma coluna Min-Max deve abranger exatamente 0 a 1, uma padronizada deve mediar 0 com desvio padrão 1 — e o método usado deve ficar registrado para quem refizer o trabalho.
Onde este fluxo termina
Esta página termina com uma tabela de trabalho limpa, conformada e escalada, e sua tabela cruzada de resumo. Ao redor estão os vizinhos que possuem etapas adjacentes — tirar estrutura de texto não estruturado é coisa do fluxo de extração de tabelas, a cirurgia de linhas e colunas num único CSV é do fluxo de utilidades CSV, auditar um conjunto de dados por anomalias de qualidade é do fluxo de qualidade de dados, e levar a tabela pronta para uma pasta ou outro formato pertence aos fluxos de ingestão e conversão. Conforme os dados aqui e entregue-os à etapa que possui o que vem a seguir.