# Profileur de qualite de dataset

Profile des jeux CSV ou JSON pour detecter manquants, doublons, derive de format, types et outliers.

> Page canonique: https://elysiatools.com/fr/tools/dataset-quality-profiler

- **Catégorie:** Data Analysis

- **Mots-clés:** qualite des donnees, csv, json, valeurs manquantes, anomalies

## Présentation

Collez un CSV dans "Entree du dataset" ou televersez un fichier CSV/JSON. Le profileur inspecte chaque colonne et fournit un apercu rapide de la qualite avant BI, ETL ou ML.

Ce qui est controle :
- Valeurs manquantes par colonne
- Lignes dupliquees ou combinaisons dupliquees selon les colonnes indiquees dans "Colonnes de doublons"
- Inferer le type de colonne : number, boolean, date, string ou empty
- Valeurs aberrantes numeriques via une regle de type IQR
- Derive de format dans les colonnes texte/date, comme des formats de date melanges ou des codes melanges au texte libre

Comment remplir les champs :
- Entree du dataset : collez directement du CSV pour un controle rapide
- Fichier de donnees : televersez CSV ou JSON si le dataset est plus grand ou deja enregistre
- Colonnes de doublons : facultatif ; indiquez des cles separees par des virgules comme id,email pour detecter les doublons par cle metier
- Lignes dechantillon : controle combien de lignes exemple apparaissent dans le rapport

Comment lire le rapport :
- Quality score est un resume rapide sur 100 ; plus il y a de manquants, doublons et signaux anormaux, plus le score baisse
- Missing indique combien de cellules vides/null ont ete trouvees dans la colonne
- Distinct indique combien de valeurs uniques apparaissent
- Anomalies met en avant les outliers numeriques
- Format drift met en avant les colonnes dont les valeurs semblent structurellement incoherentes

Perimetre actuel :
- CSV et JSON sont pris en charge
- Le JSON doit etre un tableau dobjets ou un objet contenant un tableau rows
- Le score est un signal operationnel rapide, pas une note formelle de gouvernance des donnees

## Entrées

- **Entree du dataset** (textarea): id,name,amount 1,Alice,120 2,Bob, 3,Alice,9999
- **Fichier de donnees** (file)
- **Colonnes de doublons** (text): id,email
- **Lignes dechantillon** (number)

## Quand l'utiliser

- Avant d'intégrer un nouveau jeu de données dans un tableau de bord BI ou un pipeline ETL.
- Lors de la réception d'un fichier client ou partenaire pour vérifier rapidement son intégrité structurelle.
- Pour identifier les valeurs manquantes, les anomalies numériques et les doublons sur des clés métier spécifiques.

## Fonctionnement

- Collez directement vos données CSV dans le champ texte ou téléversez un fichier CSV ou JSON.
- Spécifiez éventuellement des colonnes clés (comme 'id' ou 'email') pour cibler la détection des doublons métier.
- Ajustez le nombre de lignes d'échantillon à afficher, puis lancez l'analyse.
- Consultez le rapport HTML généré, qui inclut un score de qualité global, l'inférence des types et le détail des anomalies par colonne.

## Cas d'usage

- Nettoyage de données e-commerce pour s'assurer qu'aucun identifiant de transaction ou email client n'est dupliqué.
- Audit rapide d'un export CRM avant de lancer une campagne marketing pour évaluer le taux de champs vides.
- Validation de fichiers de capteurs IoT pour détecter les valeurs numériques aberrantes dues à des erreurs de mesure.

## Questions fréquentes

### Quels formats de fichiers sont pris en charge ?

L'outil prend en charge les textes CSV collés directement, ainsi que les fichiers CSV et JSON téléversés. Pour le JSON, il doit s'agir d'un tableau d'objets ou d'un objet contenant un tableau 'rows'.

### Comment fonctionne la détection des doublons ?

Par défaut, l'outil cherche les lignes entièrement identiques. Vous pouvez aussi renseigner des clés séparées par des virgules dans 'Colonnes de doublons' (ex: id,email) pour détecter les doublons basés uniquement sur ces identifiants.

### Qu'est-ce que la dérive de format (format drift) ?

C'est un indicateur qui se déclenche lorsqu'une colonne contient des valeurs structurellement incohérentes, comme un mélange de différents formats de dates ou du texte libre au milieu de codes standardisés.

### Comment est calculé le score de qualité (Quality score) ?

Il s'agit d'un indicateur opérationnel rapide sur 100. Le score diminue en fonction du nombre de cellules vides, de lignes dupliquées et de signaux anormaux détectés dans le jeu de données.

### Que représentent les anomalies numériques ?

L'outil utilise une règle statistique basée sur l'écart interquartile (IQR) pour repérer et mettre en évidence les valeurs numériques aberrantes (outliers) dans vos colonnes de type nombre.

## Outils associés

- [Analyseur de logs structures](https://elysiatools.com/fr/tools/structured-log-analyzer): Detecte les formats de logs courants, extrait les champs principaux et exporte en JSON, CSV ou SQL.
- [Detecteur de desequilibre et reechantillonneur](https://elysiatools.com/fr/tools/dataset-imbalance-detector-resampler): Detecte le desequilibre de classes dans un dataset CSV ou JSON, compare les strategies et previsualise un jeu equilibre
- [Detecteur d anomalies de series temporelles](https://elysiatools.com/fr/tools/time-series-anomaly-detector): Importe des donnees de series temporelles en CSV ou JSON, detecte les anomalies avec Z-Score et IQR et renvoie un rapport graphique
- [Analyseur de prevision et de saisonnalite](https://elysiatools.com/fr/tools/time-series-forecast-seasonality-analyzer): Projette des periodes futures a partir de donnees CSV ou JSON et affiche tendance, saisonnalite et residus
- [Découpage train/test stratifié](https://elysiatools.com/fr/tools/train-test-split-with-stratification): Lit un jeu de données CSV/JSON et le découpe en train/validation/test avec échantillonnage stratifié par la colonne cible (70/15/15 par défaut, graine reproductible), ou k-fold stratifié ; rapport de distribution des classes par split avec barres d'écart, contrôle des fuites par lignes dupliquées, aperçu SMOTE (interpolation des plus proches voisins sur le train) et export des CSV en ZIP.
- [Planificateur de migration CSV vers base de donnees](https://elysiatools.com/fr/tools/csv-to-database-migration-planner): Infere un schema relationnel a partir dun CSV et genere CREATE TABLE et ALTER pour PostgreSQL, MySQL, SQLite ou SQL Server
- [Visualiseur de chemins JSON](https://elysiatools.com/fr/tools/json-path-visualizer): Visualise JSON ou JSONL sous forme darbre extensible et permet de copier les expressions JSONPath de chaque noeud
- [Filigraneur de donnees CSV/JSON](https://elysiatools.com/fr/tools/csv-json-data-watermarker): Injecte des champs de filigrane visibles ou signatures dans des exports CSV ou JSON pour la tracabilite

## Exemples

- [Exemples CSV](https://elysiatools.com/fr/samples/csv-samples): Fichiers CSV d'exemple avec divers types de données, tailles et niveaux de complexité
- [Exemples Python](https://elysiatools.com/fr/samples/python): Exemples de code Python et démonstrations Hello World
- [Exemples JWT](https://elysiatools.com/fr/samples/jwt-samples): Exemples complets de JWT de la structure de base des tokens aux implémentations de sécurité avancées
- [Exemples Apache Arrow](https://elysiatools.com/fr/samples/arrow): Exemples de format colonnaire en mémoire Apache Arrow pour le traitement de données et l'analyse haute performance

## Contenu associé

- [Outils de formatage, de diff et de normalisation JSON](https://elysiatools.com/fr/hubs/json-format): Comparez les outils de formatage JSON, diff, revue de logs, comparaison de configuration et normalisation de données dans un hub unique pour les workflows JSON lisibles et vérifiables.
- [Outils de qualite des donnees, deduplication et detection d anomalies](https://elysiatools.com/fr/hubs/data-quality-anomaly-workflows): Profilez des jeux de donnees CSV/JSON, comparez des versions de tableurs et reperez doublons, valeurs aberrantes, manques, ruptures relationnelles et anomalies temporelles dans un meme hub.
- [Outils de masquage, de surlignage et de mise en forme de texte](https://elysiatools.com/fr/hubs/text-format): Comparez les outils de masquage de texte sensible, de détection de PII, de normalisation de numéros, de surlignage, de centrage et de formatage de diff dans un hub unique.
- [Outils d interchange JSON et de traduction de formats](https://elysiatools.com/fr/hubs/json-convert): Comparez les outils de conversion JSON pour CSV, YAML, TOML, GraphQL, XML, Markdown, Excel, BSON, EDN et d autres formats structures dans un meme hub.
