1. Evaluierung von ID-Lookups mit Bloomfiltern
Data EngineerHintergrund
Eine Analytics-Pipeline speichert Transaktionen in Parquet-Dateien mit mehreren Zeilengruppen und nutzt Split-Block-Bloomfilter.
Aufgabe
Es soll überprüft werden, ob Punktabfragen auf trans_id unnötige Zeilengruppen-Scans zuverlässig vermeiden.
Verwendung
Parquet-Datei hochladen und die Klausel `trans_id = 10452` in das Prädikate-Feld eingeben.
trans_id = 10452Ergebnis
Der Report zeigt, welche Zeilengruppen per Bloomfilter übersprungen werden und wie viele komprimierte Bytes eingespart wurden.