Je moet controleren of twee BigQuery-tabeloutputs identiek zijn, maar er is geen primaire sleutel. Welke aanpak levert een betrouwbare volledige tabelvergelijking op?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik een Dataproc-cluster en de BigQuery Hadoop-connector om de gegevens uit elke tabel te lezen en een hash te berekenen uit niet-timestamp kolommen van de tabel na sortering. Vergelijk de hashes van elke tabel..
Waarom dit het antwoord is
De correcte aanpak is om een Dataproc-cluster te gebruiken om de gegevens uit elke tabel te lezen, een hash te berekenen van de niet-timestamp kolommen na sortering, en vervolgens deze hashes te vergelijken. Dit garandeert een betrouwbare volledige tabelvergelijking omdat het alle rijen en kolommen (relevant voor de inhoud) in overweging neemt en de volgorde van de rijen neutraliseert door te sorteren. Het vergelijken van hashes is efficiënter dan het direct vergelijken van grote datasets. De andere opties zijn minder betrouwbaar: Willekeurige samples (met RAND() of HASH()) garanderen niet dat alle verschillen worden gedetecteerd, vooral als de verschillen subtiel zijn of in een klein deel van de gegevens voorkomen. Gestratificeerde willekeurige samples met OVER() verbeteren de representativiteit van de samples, maar blijven samples en bieden geen volledige garantie op het vinden van alle verschillen.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig