Vous devez vérifier que les sorties de deux tables BigQuery sont identiques, mais il n'y a pas de clé primaire. Quelle approche produira une comparaison fiable de l'intégralité de la table ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utilisez un cluster Dataproc et le connecteur BigQuery Hadoop pour lire les données de chaque table et calculer un hachage à partir des colonnes non-timestamp de la table après tri. Comparez les hachages de chaque table..
Pourquoi c'est la réponse
L'approche correcte garantit une comparaison fiable et exhaustive. En utilisant Dataproc et le connecteur BigQuery Hadoop, vous pouvez traiter l'intégralité des tables. Le calcul d'un hachage sur les colonnes non-timestamp (pour éviter la variabilité des horodatages) après tri garantit que l'ordre des lignes n'affecte pas le résultat et que toutes les données pertinentes sont prises en compte. La comparaison des hachages finaux permet de déterminer si les tables sont identiques. Les autres options sont insuffisantes : L'échantillonnage aléatoire (avec RAND() ou échantillonnage stratifié) ne garantit pas une comparaison complète et pourrait manquer des différences. L'utilisation de HASH() sur des échantillons aléatoires est également incomplète et ne s'applique pas directement à la comparaison de l'intégralité de tables sans clé primaire.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise