# Train/Test-Split mit Stratifizierung

Liest ein CSV/JSON-Dataset und teilt es stratifiziert nach der Zielspalte in train/validation/test (standardmäßig 70/15/15, reproduzierbarer Seed) oder stratifiziertes k-fold; Bericht zur Klassenverteilung pro Split mit Abweichungsbalken, Leck-Check über doppelte Zeilen, SMOTE-Vorschau (Nächste-Nachbarn-Interpolation auf dem Train-Split) und CSV-Export als ZIP.

> Kanonische Seite: https://elysiatools.com/de/tools/train-test-split-with-stratification

- **Kategorie:** Data Analysis

- **Schlagwörter:** stratifizierter split, train validation test, k-fold, smote, klassenverteilung, reproduzierbarer seed

## Überblick

Stratifizierter Split: Jede Klasse wird mit einem gesäten PRNG (mulberry32) gemischt, dann werden die Mitglieder per größtem Rest auf die Splits verteilt — die Klassenanteile folgen dem Dataset; der k-fold-Modus folgt der StratifiedKFold-Semantik: nach dem Mischen Round-Robin-Zuweisung (Mitglied j → Fold j mod k). SMOTE (Chawla et al. 2002) nur als Vorschau auf dem Train-Split: Für eine Minderheitsprobe x_i wird einer ihrer k=5 Minderheitsnachbarn x_z gewählt und x_new = x_i + λ·(x_z − x_i) synthetisiert, λ∈U(0,1), über numerische Spalten (euklidischer Abstand). Der Seed garantiert Reproduzierbarkeit (anderer Strom als numpys PCG64, gleichwertiges, dokumentiertes Verhalten). Seltene Klassen: Warnung, wenn eine Klasse weniger Samples als Splits hat; im k-fold wird k über der kleinsten Klasse wie bei sklearn abgelehnt.

## Eingaben

- **Dataset-Datei (CSV oder JSON)** (file): CSV with a header row, or a JSON array of objects
- **Oder CSV einfügen (mit Kopfzeile)** (textarea): age,income,label 23,42000,A 41,71000,B …
- **Zielspalte (Klassenlabel)** (text): label
- **Split-Modus** (select)
- **Trainingsanteil** (number)
- **Validierungsanteil** (number)
- **Anzahl Folds (k)** (number)
- **Zufallssaat** (number)
- **Nach Zielspalte stratifizieren** (checkbox)
- **Zeilen vor dem Split mischen** (checkbox)
- **SMOTE-Überblick (Train-Split)** (checkbox)
- **Split-CSVs als ZIP exportieren** (checkbox)

## Wann verwenden

- Wenn unbalancierte Klassifikationsdaten in Trainings-, Validierungs- und Testmengen mit identischen Klassenverhältnissen zerlegt werden müssen.
- Wenn eine k-Fold-Kreuzvalidierung erforderlich ist, bei der jede Klasse gleichmäßig auf alle Validierungsfalten verteilt wird.
- Wenn potenzielle Datenlecks zwischen Trainings- und Evaluierungsdaten vor dem Modelltraining durch Zeilenduplikat-Prüfungen ausgeschlossen werden sollen.

## Funktionsweise

- Datensatz als CSV- oder JSON-Datei hochladen oder tabellarischen CSV-Text mit Kopfzeile direkt in das Textfeld einfügen.
- Namen der Zielspalte angeben, Aufteilungsmodus wählen (Standard-Split mit prozentualer Verteilung oder k-Fold) und Zufallssaat festlegen.
- Verteilungsbericht mit Abweichungsbalken, Duplikat-Leckage-Prüfung und optionaler SMOTE-Vorschau für numerische Features auf dem Trainingssplit auswerten.
- Generierte Teil-CSVs zusammen mit dem Konfigurationsbericht split_report.json als ZIP-Archiv exportieren.

## Anwendungsfälle

- Erstellung balancierter Trainings- und Testpartitionen für überwachte Machine-Learning-Pipelines in Python oder R.
- Stratifizierte Datenaufteilung bei ungleich verteilten Zielvariablen wie Betrugserkennung, Churn-Prognosen oder Krankheitsdiagnosen.
- Strukturierte Vorbereitung von Folds für die k-fache Kreuzvalidierung beim Hyperparameter-Tuning.

## Häufig gestellte Fragen

### Wie wird die Reproduzierbarkeit der Splits sichergestellt?

Das Tool nutzt einen deterministischen Pseudozufallszahlengenerator (mulberry32) mit konfigurierbarem Seed, wodurch identische Eingaben stets exakt dieselbe Zeilenzuordnung erzeugen.

### Was passiert, wenn eine Klasse weniger Einträge als Splits hat?

Das Tool gibt bei seltenen Klassen eine Warnung aus. Im k-Fold-Modus wird ein k-Wert, der die Anzahl der Instanzen der kleinsten Klasse übersteigt, analog zu scikit-learn abgewiesen.

### Auf welche Daten wird die SMOTE-Vorschau angewendet?

Die SMOTE-Interpolation (k=5 nächste Nachbarn über numerische Spalten) wird ausschließlich auf dem Trainings-Split berechnet, um Informationsabflüsse in Validierungs- oder Testdaten zu verhindern.

### Wie erkennt das Tool Datenlecks zwischen den Splits?

Es führt einen zeilenbasierten Hash-Abgleich durch und markiert identische Datensätze, die gleichzeitig in Trainings- und Test- bzw. Validierungs-Splits vorkommen.

### Welche Dateien enthält der exportierte ZIP-Download?

Das ZIP-Archiv enthält die getrennten CSV-Dateien für jeden Split oder jeden Fold sowie die Datei split_report.json mit Metadaten zur Klassenverteilung.

## Ähnliche Tools

- [Zeitreihen-Prognose- und Saisonalitaetsanalyse](https://elysiatools.com/de/tools/time-series-forecast-seasonality-analyzer): Prognostiziert kuenftige Perioden aus CSV- oder JSON-Zeitreihen und zeigt Trend, Saison und Residuen in einem Bericht
- [CSV-zu-Datenbank-Migrationsplaner](https://elysiatools.com/de/tools/csv-to-database-migration-planner): Leitet aus CSV-Daten ein relationales Schema ab und erzeugt CREATE-TABLE- und ALTER-Plaene fuer PostgreSQL, MySQL, SQLite oder SQL Server
- [CSV/JSON-Daten-Watermarker](https://elysiatools.com/de/tools/csv-json-data-watermarker): Fuegt sichtbare oder signaturbasierte Wasserzeichenfelder in CSV- oder JSON-Exporte ein, um Freigaben spaeter nachzuverfolgen
- [Datensatz-Imbalance-Detektor und Resampler](https://elysiatools.com/de/tools/dataset-imbalance-detector-resampler): Erkennt Klassenungleichgewicht in CSV- oder JSON-Datensaetzen, vergleicht Strategien und zeigt ein balanciertes Ergebnis
- [Datensatzqualitaets-Profiler](https://elysiatools.com/de/tools/dataset-quality-profiler): Profiling fuer CSV- oder JSON-Datensaetze mit Fehlwerten, Duplikaten, Formatdrift, Typen und Ausreissern.
- [Fitness-Workout-PDF-Generator](https://elysiatools.com/de/tools/fitness-workout-pdf-generator): Erstellt einen druckbaren Trainingsplan als PDF aus JSON oder CSV mit Tabellen, Fortschrittsfeldern und optionalen QR-Codes
- [JSON-LD-Generator aus CSV](https://elysiatools.com/de/tools/json-ld-generator-from-csv): Wandelt CSV- oder Excel-Zeilen in Schema.org-JSON-LD fuer Artikel, Produkte oder Events um und liefert validierungsbereite SEO-Ausgaben
- [Podcast-Kapitelmarken-Generator (ID3 / Podcasting 2.0)](https://elysiatools.com/de/tools/podcast-chapter-marker-builder): Füge eine zeitcodierte Kapitelliste ein und erzeuge alle Auslieferungsformate auf einmal: Podcasting-2.0-Kapitel-JSON (v1.2.0) und RSS-Tag podcast:chapters, optionales Einbrennen der ID3v2.4-CHAP+CTOC-Frames in eine hochgeladene MP3 (Millisekunden als normaler Big-Endian-uint32, Offsets 0xFFFFFFFF, TIT2-Subframe pro Kapitel, bestehende Frames bleiben erhalten), Vorbis-Kommentarpaare CHAPTER001 (OGG/Opus), mp4chaps-Text, Zeitstempelblock für die YouTube-Beschreibung und SRT-Sidecar, plus die echte Player-Supportmatrix (Apple nimmt RSS-JSON seit 2025; Pocket Casts/Overcast lesen nur eingebettetes ID3; Spotify ignoriert beide).

## Beispiele

- [CSV Beispiele](https://elysiatools.com/de/samples/csv-samples): CSV-Beispieldateien mit verschiedenen Datentypen, Größen und Komplexitätsstufen
- [Python Beispiele](https://elysiatools.com/de/samples/python): Python Code-Beispiele und Hello World Demonstrationen
- [WebRTC Echtzeitkommunikation Beispiele](https://elysiatools.com/de/samples/webrtc-samples): Umfassende WebRTC-Beispiele für P2P Audio/Video-Kommunikation, Datenkanäle, Bildschirmfreigabe und Signalisierungsserver
- [Distributed Tracing Beispiele](https://elysiatools.com/de/samples/distributed-tracing-samples): Umfassende Beispiele für verteiltes Tracing mit Jaeger, OpenTelemetry und modernen Observability Tools

## Verwandte Inhalte

- [Tools fur JSON-Austausch und Format-Ubersetzung](https://elysiatools.com/de/hubs/json-convert): Vergleiche JSON-Konvertierungswerkzeuge fur CSV, YAML, TOML, GraphQL, XML, Markdown, Excel, BSON, EDN und ahnliche strukturierte Formate in einem Hub.
- [Textfall-, Encoding- und Normalisierungs-Konvertierungs-Tools](https://elysiatools.com/de/hubs/text-convert): Vergleichen Sie Textfall-Konvertierung, Zeichenbreiten-Konvertierung, Encoding-Konvertierung, Quoted-Printable-Verarbeitung und Inline-Textnormalisierung in einem Hub.
- [Tools fur CSV-Export und Tabellenkonvertierung](https://elysiatools.com/de/hubs/csv-convert): Vergleiche CSV-Umwandlungen zu und von Excel, JSON, HTML, Markdown, XML und Text in einem Hub fur tabellarische Austausch-Workflows.
- [Werkzeuge fur JSON-Inspektion, Diff und Transformation](https://elysiatools.com/de/hubs/json-utility): Bunde JSON-Formatierung, Diff, Pfad-Inspektion, Schema-Prufung, Merge und Transformation in einem Hub fur API- und Daten-Workflows.
