Un'azienda estrae circa 1 TB di dati al giorno da fonti come SAP HANA, SQL Server, MongoDB, Kafka e DynamoDB. Alcune fonti hanno schemi indefiniti o in evoluzione. La soluzione deve rilevare gli schemi, eseguire l'ETL e caricare i dati in S3 entro 15 minuti dalla creazione dei dati. Quale approccio fornisce la funzionalità richiesta con il minor overhead operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare AWS Glue per rilevare lo schema ed estrarre, trasformare e caricare i dati nel bucket S3. Creare una pipeline in Apache Spark..
Perché questa è la risposta
AWS Glue è la scelta migliore per questo scenario perché è un servizio ETL serverless completamente gestito che include un crawler per il rilevamento automatico dello schema da varie fonti di dati, inclusi quelli con schemi indefiniti o in evoluzione. Questo riduce significativamente l'overhead operativo rispetto alla gestione di un cluster EMR. L'integrazione di Apache Spark in AWS Glue consente l'elaborazione efficiente di grandi volumi di dati (1 TB al giorno) e soddisfa il requisito di latenza di 15 minuti. Amazon EMR richiederebbe la gestione del cluster, aumentando l'overhead operativo. AWS Lambda non è adatto per l'elaborazione di 1 TB di dati al giorno a causa delle sue limitazioni di tempo di esecuzione e memoria. Amazon Redshift è un data warehouse e non è progettato per il rilevamento dello schema o l'ETL da fonti eterogenee direttamente in S3 con la flessibilità richiesta.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta