È necessario eseguire un'analisi esplorativa dei dati (EDA) su un dataset di petabyte, senza gestire l'infrastruttura del cluster, pagando solo per le query eseguite e scrivendo l'analisi in Python da un notebook Jupyter. Quale soluzione soddisfa questi vincoli?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Eseguire Apache Spark da Amazon Athena..
Perché questa è la risposta
L'esecuzione di Apache Spark da Amazon Athena è la soluzione migliore perché Athena consente l'analisi di petabyte di dati direttamente da S3, senza la necessità di gestire l'infrastruttura del cluster. Si paga solo per le query eseguite, soddisfacendo il requisito di costo. L'integrazione con Jupyter Notebooks tramite librerie come PyAthena o boto3 permette di scrivere l'analisi in Python. Eseguire Apache Spark da Amazon SageMaker richiederebbe la gestione dell'infrastruttura sottostante (es. istanze EC2 per Spark), violando il vincolo "senza gestire l'infrastruttura". Eseguire Apache Spark su un cluster Amazon EMR di cui si esegue il provisioning implica la gestione esplicita del cluster EMR, che è esattamente ciò che si vuole evitare. Utilizzare Apache Spark integrato con Amazon Redshift non è l'opzione più adatta per l'EDA su petabyte di dati non strutturati o semi-strutturati in S3, in quanto Redshift è un data warehouse relazionale e comporterebbe costi e gestione aggiuntivi per l'ingestione dei dati.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta