AdView Inc. vuole creare un singolo flusso SageMaker Data Wrangler che unisca un CSV S3 di log di campagne con una tabella Redshift di profili cliente e quindi esporti il dataset pulito e unito in Parquet. Il cluster Redshift si trova in una sottorete privata. Qual è la sequenza corretta di azioni per implementare questo in Data Wrangler garantendo connettività e correttezza?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Caricare il CSV S3 come dataset di Data Wrangler e aggiungere Redshift come un altro dataset nel flusso utilizzando le credenziali JDBC di Redshift. Aggiungere una trasformazione Join nel flusso specificando le chiavi di join. Configurare l'elaborazione/esportazione del flusso Data Wrangler per l'esecuzione in una VPC con sottoreti e gruppi di sicurezza che consentano l'accesso al cluster Redshift, e assicurarsi che il ruolo IAM utilizzato da Data Wrangler abbia i permessi per accedere a S3 e alle credenziali Redshift..
Perché questa è la risposta
L'opzione corretta descrive il processo standard per unire dati da S3 e Redshift in Data Wrangler. È necessario caricare entrambi i dataset, specificare le credenziali JDBC per Redshift e configurare la trasformazione di join. Poiché il cluster Redshift si trova in una sottorete privata, è fondamentale configurare l'esecuzione del flusso Data Wrangler all'interno di una VPC che abbia connettività a Redshift, includendo sottoreti e gruppi di sicurezza appropriati. Inoltre, il ruolo IAM deve avere i permessi necessari per accedere a S3, a Redshift e alle credenziali. Le altre opzioni sono errate perché: Data Wrangler non crea automaticamente un proxy di database Redshift senza configurazione VPC per un cluster privato. Esportare entrambi i dataset su S3 e usare Glue ETL è una soluzione alternativa ma non utilizza Data Wrangler per la join, contraddicendo il requisito. Data Wrangler non può spingere una join a Redshift tramite query federata senza configurazione di rete o credenziali esplicite, e l'uso di un crawler Glue per il CSV S3 non risolve la connettività a Redshift.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta