1. Stratifizierter 70/15/15-Split für Textklassifikation
Data ScientistHintergrund
Ein Datensatz mit 24 Kundenrezensionen enthält drei unausgewogene Stimmungsklassen (10 positive, 9 negative, 5 neutrale Bewertungen).
Aufgabe
Ein zufälliger Split könnte dazu führen, dass die neutrale Klasse im Testdatensatz unterrepräsentiert ist oder vollständig fehlt.
Verwendung
Textdaten einfügen, Zielspalte auf 'label' setzen, Standard-Split mit 70 % Training und 15 % Validierung wählen und die Zufallssaat auf 42 einstellen.
targetColumn: 'label', splitMode: 'standard', trainPercent: 70, valPercent: 15, randomSeed: 42, stratify: true, shuffle: true, exportZip: trueErgebnis
Der Datensatz wird in 16 Trainings-, 5 Validierungs- und 3 Testzeilen aufgeteilt, wobei alle drei Klassen proportional vertreten sind und als ZIP bereitstehen.