Eine Arbeitstabelle, dann ein Regelwerk
Datenbereitstellung scheitert am häufigsten daran, zweimal nach verschiedenen Maßstäben gemacht zu werden. Zwei separat bereinigte Exporte ziehen zwei Datumsformate und zwei Kategorieschreibweisen groß, und ihre Zusammenführung reißt jede Wunde wieder auf. Die Reihenfolge hier verhindert das — zuerst zusammenführen, damit der Spaltenabgleich einmal über alle Quellen läuft, dann einmal über die ganze Tabelle bereinigen, und jeder spätere Schritt wendet eine einzige Richtlinie auf eine einzige Tabelle an. Die Voraussetzung ist Ehrlichkeit über die Spalten, die zählen — vor der Arbeit einengen halbiert die Fläche, auf der Fehler brüten können.
Die Fallen, die man nicht sehen kann
Zwei unsichtbare Fehler erklären die meisten stillen Vorbereitungsbugs. Die Byte-Order-Marke sitzt vor dem Namen der ersten Spalte, tut so als wäre sie nichts, und bricht jeden exakten Abgleich gegen ihn — ihre Signatur ist der Join, der null Zeilen ohne Fehlermeldung liefert. Duplikate sind die zweite — zwei Zeilen, die in jedem Feld übereinstimmen, sind eine Tatsache, die zweimal gezählt wird, und jede darauf gebaute Summe lügt um genau so viel. Beide Fallen sind billig zu entschärfen — Marke entfernen, Tabelle deduplizieren — und teuer, flussabwärts zu entdecken, deshalb stehen sie vor allem Cleveren.
Ausreißer sind Entscheidungen, keine Flecken
Ein Ausreißer ist kein Schmutz — er ist ein Datenpunkt mit klarer Position — ich bin ein Glitch, oder ich bin das Ereignis, dessentwegen Sie gekommen sind. Ihn zu entfernen ist ein Domänenurteil mit statistischen Folgen, deshalb zwingt dieser Workflow die Entscheidung ins Offene — eine erklärte Richtlinie pro Spalte, ausgeführt und gezählt. Ersetzen Sie durch Median oder Deckel, wenn die Enden weicher, die Zeilen aber bleiben sollen; markieren Sie, wenn die nachgelagerte Analyse die Stimme verdient; löschen Sie, wenn der Wert nachweisbar falsch ist. Die Richtlinie gehört ins Protokoll, denn ein Ergebnis, das nicht sagen kann, wie es mit seinen Extremen umging, kann sich auch nicht verteidigen.
Die Skalierung folgt dem Abnehmer
Min-Max und Z-Wert sind keine austauschbaren Gewohnheiten. Min-Max bannt alles in einen Bereich 0 bis 1 und hält die Form — gut, wenn die Methode begrenzte Eingaben will, zerbrechlich, wenn ein Extremwert den Rest gegen null drückt. Der Z-Wert zentriert die Spalten auf null mit Einheitsvarianz und zuckt vor schweren Enden nicht — richtig für Methoden, die in Standardabweichungen messen. Die Prüfung ist arithmetisch, nicht visuell — eine Min-Max-Spalte muss exakt 0 bis 1 spannen, eine standardisierte muss 0 mitteln mit Standardabweichung 1 — und die benutzte Methode muss festgehalten bleiben für jeden, der die Arbeit erneut ausführt.
Wo dieser Workflow endet
Diese Seite endet mit einer sauberen, geformten, skalierten Arbeitstabelle und ihrer Kreuztabelle. Darum sitzen die Nachbarn mit angrenzenden Etappen — aus unstrukturiertem Text Struktur zu ziehen ist Sache des Tabellenextraktions-Workflows, Zeilen- und Spaltenchirurgie an einer einzelnen CSV die des CSV-Nutzungs-Workflows, ein Datenbestand auf Qualitätsanomalien zu prüfen die des Datenqualitäts-Workflows, und die fertige Tabelle in ein Arbeitsbuch oder ein anderes Format zu tragen gehört den Ingestion- und Konvertierungs-Workflows. Formen Sie die Daten hier und übergeben Sie sie der Etappe, die das Weitere besitzt.