# Datensatzqualitaets-Profiler

Profiling fuer CSV- oder JSON-Datensaetze mit Fehlwerten, Duplikaten, Formatdrift, Typen und Ausreissern.

> Kanonische Seite: https://elysiatools.com/de/tools/dataset-quality-profiler

- **Kategorie:** Data Analysis

- **Schlagwörter:** datenqualitaet, csv, json, fehlwerte, anomalien

## Überblick

Fuegen Sie CSV in "Datensatz-Eingabe" ein oder laden Sie eine CSV-/JSON-Datei hoch. Der Profiler untersucht jede Spalte und liefert einen schnellen Qualitaetsblick vor BI, ETL oder ML.

Was geprueft wird:
- Fehlwerte pro Spalte
- Doppelte Zeilen oder doppelte Kombinationen anhand der in "Duplikatspalten" angegebenen Felder
- Typinferenz fuer Spalten: number, boolean, date, string oder empty
- Numerische Ausreisser per IQR-aehnlicher Regel
- Formatdrift in String-/Datumsfeldern, etwa gemischte Datumsstile oder Codes zusammen mit Freitext

So werden die Felder befuellt:
- Datensatz-Eingabe: CSV-Text direkt einfuegen fuer ein schnelles Profil
- Datendatei: CSV oder JSON hochladen, wenn der Datensatz groesser ist oder lokal vorliegt
- Duplikatspalten: optional; kommagetrennte Schluessel wie id,email, um Duplikate nach Geschaeftsschluessel statt ganzer Zeile zu finden
- Beispielzeilen: steuert, wie viele Beispielzeilen im Bericht angezeigt werden

So liest man den Bericht:
- Quality score ist eine schnelle 0-100-Zusammenfassung; mehr Fehlwerte, Duplikate und Anomalien senken den Wert
- Missing zeigt, wie viele leere/null-Zellen in der Spalte gefunden wurden
- Distinct zeigt, wie viele unterschiedliche Werte vorkommen
- Anomalies hebt numerische Ausreisser hervor
- Format drift markiert Spalten mit strukturell uneinheitlichen Werten

Aktueller Umfang:
- CSV und JSON werden unterstuetzt
- JSON sollte ein Array von Objekten oder ein Objekt mit rows-Array sein
- Der Score ist ein schneller operativer Hinweis und keine formale Data-Governance-Benotung

## Eingaben

- **Datensatz-Eingabe** (textarea): id,name,amount 1,Alice,120 2,Bob, 3,Alice,9999
- **Datendatei** (file)
- **Duplikatspalten** (text): id,email
- **Beispielzeilen** (number)

## Wann verwenden

- Vor dem Import von Rohdaten in Business-Intelligence-Dashboards zur Vermeidung von Darstellungsfehlern.
- Zur schnellen Überprüfung von ETL-Pipelines auf fehlende Werte oder unerwartete Formatänderungen.
- Bei der Vorbereitung von Machine-Learning-Trainingsdaten, um numerische Ausreißer und Duplikate frühzeitig zu erkennen.

## Funktionsweise

- Fügen Sie Ihre CSV-Daten in das Textfeld ein oder laden Sie eine CSV- bzw. JSON-Datei hoch.
- Definieren Sie optional spezifische Spalten (z. B. "id,email"), um Duplikate anhand von Geschäftsschlüsseln zu identifizieren.
- Legen Sie die Anzahl der gewünschten Beispielzeilen fest, die im Bericht angezeigt werden sollen.
- Das Tool generiert einen HTML-Bericht mit einem Quality Score, Typinferenz und Warnungen zu Anomalien oder Formatdrift.

## Anwendungsfälle

- Überprüfung von exportierten Kundenlisten auf doppelte E-Mail-Adressen und fehlende Namen.
- Qualitätssicherung von Transaktionsdaten vor der Erstellung von monatlichen Finanz-Dashboards.
- Erkennung von fehlerhaften Sensorwerten (Ausreißern) in IoT-Datenprotokollen.

## Häufig gestellte Fragen

### Welche Dateiformate werden unterstützt?

Das Tool unterstützt CSV- und JSON-Dateien. JSON-Daten sollten als Array von Objekten oder als Objekt mit einem "rows"-Array formatiert sein.

### Wie wird der Quality Score berechnet?

Der Score ist ein Wert von 0 bis 100. Er sinkt, je mehr leere Zellen, doppelte Zeilen oder Anomalien im Datensatz gefunden werden.

### Was bedeutet "Format drift" im Bericht?

Formatdrift zeigt an, dass die Werte in einer Spalte strukturell uneinheitlich sind, beispielsweise wenn Datumsformate gemischt werden oder Text in einer Zahlenspalte auftaucht.

### Kann ich Duplikate nur anhand bestimmter Spalten finden?

Ja, Sie können im Feld "Duplikatspalten" kommagetrennte Spaltennamen (wie "id,email") angeben, um gezielt nach doppelten Geschäftsschlüsseln zu suchen, anstatt ganze Zeilen zu vergleichen.

### Ist dieses Tool ein Ersatz für Data-Governance-Software?

Nein, der Profiler liefert einen schnellen operativen Hinweis auf die Datenqualität und ist keine formale Data-Governance-Benotung.

## Ähnliche Tools

- [Analysator fuer strukturierte Logs](https://elysiatools.com/de/tools/structured-log-analyzer): Erkennt gaengige Logformate, extrahiert Kernfelder und exportiert als JSON, CSV oder SQL.
- [Datensatz-Imbalance-Detektor und Resampler](https://elysiatools.com/de/tools/dataset-imbalance-detector-resampler): Erkennt Klassenungleichgewicht in CSV- oder JSON-Datensaetzen, vergleicht Strategien und zeigt ein balanciertes Ergebnis
- [Zeitreihen-Anomalie-Detektor](https://elysiatools.com/de/tools/time-series-anomaly-detector): Liest Zeitreihendaten aus CSV oder JSON ein, erkennt Anomalien per Z-Score und IQR und gibt einen Chart-gestuetzten Bericht aus
- [Zeitreihen-Prognose- und Saisonalitaetsanalyse](https://elysiatools.com/de/tools/time-series-forecast-seasonality-analyzer): Prognostiziert kuenftige Perioden aus CSV- oder JSON-Zeitreihen und zeigt Trend, Saison und Residuen in einem Bericht
- [Train/Test-Split mit Stratifizierung](https://elysiatools.com/de/tools/train-test-split-with-stratification): Liest ein CSV/JSON-Dataset und teilt es stratifiziert nach der Zielspalte in train/validation/test (standardmäßig 70/15/15, reproduzierbarer Seed) oder stratifiziertes k-fold; Bericht zur Klassenverteilung pro Split mit Abweichungsbalken, Leck-Check über doppelte Zeilen, SMOTE-Vorschau (Nächste-Nachbarn-Interpolation auf dem Train-Split) und CSV-Export als ZIP.
- [CSV-zu-Datenbank-Migrationsplaner](https://elysiatools.com/de/tools/csv-to-database-migration-planner): Leitet aus CSV-Daten ein relationales Schema ab und erzeugt CREATE-TABLE- und ALTER-Plaene fuer PostgreSQL, MySQL, SQLite oder SQL Server
- [JSON-Pfad-Visualizer](https://elysiatools.com/de/tools/json-path-visualizer): Visualisiert JSON oder JSONL als aufklappbaren Baum und kopiert JSONPath-Ausdruecke fuer jeden Knoten
- [CSV/JSON-Daten-Watermarker](https://elysiatools.com/de/tools/csv-json-data-watermarker): Fuegt sichtbare oder signaturbasierte Wasserzeichenfelder in CSV- oder JSON-Exporte ein, um Freigaben spaeter nachzuverfolgen

## Beispiele

- [CSV Beispiele](https://elysiatools.com/de/samples/csv-samples): CSV-Beispieldateien mit verschiedenen Datentypen, Größen und Komplexitätsstufen
- [Python Beispiele](https://elysiatools.com/de/samples/python): Python Code-Beispiele und Hello World Demonstrationen
- [JWT-Beispiele](https://elysiatools.com/de/samples/jwt-samples): Umfassende JWT-Beispiele von der grundlegenden Token-Struktur bis zu fortgeschrittenen Sicherheitsimplementierungen
- [Apache Arrow Beispiele](https://elysiatools.com/de/samples/arrow): Apache Arrow In-Memory Columnar Format Beispiele für Hochleistungs-Datenverarbeitung und -Analyse

## Verwandte Inhalte

- [JSON-Formatierungs-, Diff- und Normalisierungs-Tools](https://elysiatools.com/de/hubs/json-format): Vergleichen Sie JSON-Formatierung, Diff, Log-Review, Konfigurationsvergleich und Datennormalisierung in einem Hub für lesbare und überprüfbare JSON-Workflows.
- [Tools fuer Datenqualitaet, Dublettenbereinigung und Anomalieerkennung](https://elysiatools.com/de/hubs/data-quality-anomaly-workflows): Profilieren Sie CSV/JSON-Datensaetze, vergleichen Sie Tabellenversionen und finden Sie Dubletten, Ausreisser, fehlende Werte, Beziehungsbrueche und Zeitreihenanomalien in einem Hub fuer Datenqualitaet.
- [Text-Redaktions-, Hervorhebungs- und Darstellungsformatierungs-Tools](https://elysiatools.com/de/hubs/text-format): Vergleichen Sie Tools zum Maskieren sensibler Texte, Finden von PII, Normalisieren von Telefonnummern, Hervorheben von Phrasen, Zentrieren von Text und Formatieren von Diffs in einem Hub.
- [Tools fur JSON-Austausch und Format-Ubersetzung](https://elysiatools.com/de/hubs/json-convert): Vergleiche JSON-Konvertierungswerkzeuge fur CSV, YAML, TOML, GraphQL, XML, Markdown, Excel, BSON, EDN und ahnliche strukturierte Formate in einem Hub.
