Hai dati di sensori IoT per il suolo in una tabella Amazon DynamoDB da 10 GB e dati di eventi meteorologici come file JSON da 5 GB in Amazon S3. Vuoi preparare questo set di dati combinato per addestrare un modello Amazon SageMaker con il minimo overhead amministrativo. Quale approccio realizza al meglio la trasformazione richiesta?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Eseguire crawler AWS Glue per catalogare i dati. Creare un job ETL AWS Glue che unisce i set di dati DynamoDB e S3 e scrive l'output unito come file CSV in Amazon S3..
Perché questa è la risposta
L'approccio corretto sfrutta AWS Glue per la catalogazione e la trasformazione dei dati, minimizzando l'overhead amministrativo. I crawler AWS Glue scoprono automaticamente lo schema dei dati in DynamoDB e S3, creando tabelle nel Glue Data Catalog. Un job ETL AWS Glue può quindi unire questi set di dati e scrivere il risultato in S3 in un formato adatto per SageMaker (come CSV), senza la necessità di gestire server. Avviare un cluster Amazon EMR è efficace ma comporta un maggiore overhead amministrativo per la gestione del cluster. Scrivere l'output in Amazon Redshift è una soluzione valida per l'analisi, ma non è l'opzione più diretta per preparare i dati per SageMaker, che spesso consuma dati direttamente da S3. Abilitare DynamoDB Streams e usare Lambda per modificare file S3 esistenti è un approccio orientato all'elaborazione in tempo reale degli aggiornamenti, non alla preparazione iniziale di un dataset combinato di grandi dimensioni.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta