Il flusso di dati IoT da Cloud Pub/Sub tramite Dataflow a BigQuery mostra circa il 2% di record corrotti in un'anteprima. Come si dovrebbe modificare la pipeline di Cloud Dataflow per filtrare i dati corrotti?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Aggiungere una trasformazione ParDo in Cloud Dataflow per scartare gli elementi corrotti..
Perché questa è la risposta
La risposta corretta è aggiungere una trasformazione ParDo in Cloud Dataflow per scartare gli elementi corrotti. Una trasformazione ParDo (Parallel Do) è il modo standard e più efficiente per elaborare elementi individuali in una pipeline Dataflow. Permette di definire una logica personalizzata per filtrare, trasformare o arricchire i dati. In questo caso, si implementerebbe una funzione all'interno del ParDo che valuta ogni record e, se identificato come corrotto, non lo emette al passo successivo della pipeline, scartandolo efficacemente. Le altre opzioni sono meno appropriate: L'aggiunta di un SideInput che restituisce un valore booleano non è il meccanismo corretto per filtrare gli elementi. I SideInput sono usati per fornire dati aggiuntivi a una trasformazione, non per la logica di filtraggio principale. Una trasformazione Partition è usata per dividere un PCollection in più PCollection basate su una chiave o una condizione, ma non è il metodo più diretto per scartare i dati. Sebbene possa separare i dati validi da quelli corrotti, richiederebbe un passo aggiuntivo per scartare esplicitamente i dati corrotti. Una trasformazione GroupByKey è usata per raggruppare elementi con la stessa chiave e non è adatta per filtrare record corrotti individualmente.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta