1. Vorbereitung von Kundendaten für Clustering
DatenanalystHintergrund
Ein Datensatz enthält Kundenalter und jährliches Einkommen in völlig unterschiedlichen Wertebereichen.
Aufgabe
Die unterschiedlichen Skalen führen dazu, dass das Einkommen die Distanzberechnung im Clustering-Algorithmus dominiert.
Verwendung
CSV-Daten einfügen, 'age' und 'salary' als Zielspalten wählen und Z-Score Standardisierung anwenden.
standardizationType: zscore, targetColumns: age, salaryErgebnis
Beide Merkmale haben nun einen Mittelwert von 0 und eine Standardabweichung von 1, was eine faire Gewichtung im Algorithmus ermöglicht.