Sie müssen überprüfen, ob zwei BigQuery-Tabellenausgaben identisch sind, aber es gibt keinen Primärschlüssel. Welcher Ansatz führt zu einem zuverlässigen vollständigen Tabellenvergleich?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Verwenden Sie einen Dataproc-Cluster und den BigQuery Hadoop-Konnektor, um die Daten aus jeder Tabelle zu lesen und nach dem Sortieren einen Hash aus Nicht-Zeitstempelspalten der Tabelle zu berechnen. Vergleichen Sie die Hashes jeder Tabelle..
Warum dies die Antwort ist
Die korrekte Antwort ist, einen Dataproc-Cluster zu verwenden, um die Daten zu lesen, zu sortieren und Hashes zu vergleichen. Dies ist der zuverlässigste Ansatz für einen vollständigen Tabellenvergleich ohne Primärschlüssel. Das Sortieren der Daten vor dem Hashing stellt sicher, dass die Reihenfolge der Zeilen die Hash-Berechnung nicht beeinflusst. Das Ausschließen von Zeitstempelspalten ist wichtig, da diese sich bei identischen Daten unterscheiden können und somit zu falschen Unterschieden führen würden. Zufällige Stichproben (Optionen 1, 2 und 4) sind unzuverlässig, da sie nicht garantieren, dass alle Zeilen verglichen werden, und somit potenzielle Unterschiede übersehen werden könnten.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich