1. Élagage mixte sur un dataset partitionné en deux groupes de lignes
Ingénieur Data LakeContexte
Un fichier Parquet de 100 lignes comporte deux groupes de lignes (identifiants 1-50 et 51-100) dotés de filtres bloom SBBF et de statistiques min/max.
Problème
Mesurer l'impact de plusieurs filtres ciblés sur les identifiants et les noms pour éviter des lectures inutiles.
Utilisation
Uploadez le fichier Parquet et saisissez les prédicats dans la zone de texte.
id = 75
id > 60
name = 'zeta'Résultat
Le prédicat id = 75 élague le groupe 0 par zone map, id > 60 économise 50 % des octets, et name = 'zeta' élague 100 % des groupes.