Un'azienda ha tre filiali che utilizzano diversi motori di warehousing (Amazon Redshift, Teradata Vantage su AWS e Google BigQuery). Vogliono consolidare i dati in un data lake S3 utilizzando Apache Iceberg. La nuova pipeline deve connettersi a ciascuna origine, eseguire trasformazioni utilizzando ciascun motore di origine, unire i risultati e scrivere su Iceberg con il minimo sforzo operativo. Quale approccio soddisfa questi requisiti con il minor overhead operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare i connettori di query federate di Amazon Athena per Amazon Redshift, Teradata e BigQuery per costruire la pipeline in Athena. Scrivere una query SQL per leggere da tutte le origini dati, unire i dati ed eseguire un'operazione Merge sulla tabella Iceberg del data lake..
Perché questa è la risposta
L'opzione corretta è l'approccio con Amazon Athena Federated Query. Questo perché Athena consente di interrogare direttamente i dati da diverse fonti (Redshift, Teradata, BigQuery) utilizzando connettori predefiniti, riducendo significativamente lo sforzo operativo. Si può scrivere una singola query SQL per unire i dati e scrivere su Iceberg, eliminando la necessità di spostare o trasformare i dati prima dell'ingestione. Le altre opzioni presentano maggiori overhead operativi: AWS Glue richiederebbe lo sviluppo di script ETL complessi per gestire le diverse fonti e le trasformazioni. Amazon EMR implica la gestione di cluster e lo sviluppo di codice PySpark, aumentando la complessità operativa. Amazon AppFlow è più orientato al trasferimento di dati SaaS e richiederebbe passaggi aggiuntivi con Athena per l'unione e la scrittura su Iceberg.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta