È necessario verificare che due output di tabelle BigQuery siano identici, ma non esiste una chiave primaria. Quale approccio produrrà un confronto affidabile dell'intera tabella?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare un cluster Dataproc e il connettore BigQuery Hadoop per leggere i dati da ciascuna tabella e calcolare un hash dalle colonne non-timestamp della tabella dopo l'ordinamento. Confrontare gli hash di ciascuna tabella..
Perché questa è la risposta
L'opzione corretta garantisce un confronto affidabile dell'intera tabella calcolando un hash deterministico su tutte le colonne non-timestamp, dopo aver ordinato i dati per garantire la coerenza dell'ordine dei record. L'uso di Dataproc e del connettore BigQuery Hadoop è appropriato per gestire grandi volumi di dati. Le opzioni che utilizzano il campionamento casuale (A, B, D) non garantiscono un confronto completo e potrebbero non rilevare differenze sottili o localizzate. La funzione RAND() (A) non è deterministica, mentre HASH() (B) su campioni non è sufficiente. Il campionamento stratificato (D) migliora il campionamento ma non è un confronto esaustivo dell'intera tabella.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta