Définir le livrable avant le fichier
Un traitement ETL devient vérifiable lorsque chaque entrée possède un identifiant de source et de lot stable. Notez la capture de fichier ou d’API, le préfixe objet éventuel, la feuille ou la plage et la forme attendue. Gardez l’original immuable afin de rejouer une correction de normalisation.
Normaliser avant de fusionner
Atterrissez d’abord les pages API ou les lots objet, puis traitez séparateurs et encodages CSV. Le séparateur de feuilles et l’extracteur de plages évitent d’inclure notes et totaux. Le mappeur fixe les noms et l’ordre ; unpivot transforme les colonnes de mois en observations quand la cible est longue. Fusionnez seulement des contrats compatibles et rendez le curseur visible dans la filiation.
Revoir le contrat et le SQL
Le JSON Schema produit à partir d’exemples est un point de départ, pas une décision finale. Comparez-le au plan de migration, à la clé métier, à la nullabilité et au dialecte avant d’accepter les INSERT. Les outils construisent les artefacts, mais ne remplacent pas une transaction ni une décision de changement de type.
Rapprocher avant de remettre
Avant l’export, rapprochez lignes entrantes, acceptées, dupliquées, rejetées et produites. Vérifiez champs, types, unicité et dérive de schéma. Parquet et NDJSON conviennent à l’analytique ; le paquet CSV avec manifest facilite le contrôle par feuille. En cas d’échec, isolez la branche et conservez sa filiation plutôt que de publier un résultat partiel.