Uno scienziato dei dati ha 20 TB di dati CSV in Amazon S3 e deve convertirli in Apache Parquet con il minimo sforzo. Qual è il modo più semplice per eseguire questa conversione?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Scrivere uno script di conversione ed eseguirlo come job AWS Glue per leggere il CSV e scrivere l'output Parquet..
Perché questa è la risposta
La risposta corretta è scrivere uno script di conversione ed eseguirlo come job AWS Glue. AWS Glue è un servizio ETL (Extract, Transform, Load) serverless che si integra nativamente con Amazon S3 e supporta Apache Parquet. Eseguire uno script di conversione (ad esempio, in PySpark) come job Glue è il modo più efficiente e scalabile per gestire grandi volumi di dati (20 TB) con il minimo sforzo operativo, poiché Glue gestisce l'infrastruttura sottostante. Utilizzare un crawler AWS Glue non è sufficiente, poiché i crawler scoprono solo lo schema dei dati, non eseguono la conversione del formato. Eseguire uno script su un cluster Amazon EMR richiederebbe la gestione del cluster, aumentando lo sforzo operativo. Eseguire uno script da un notebook Amazon SageMaker non è adatto per 20 TB di dati, in quanto i notebook non sono progettati per elaborazioni di questa scala e potrebbero incorrere in problemi di memoria o timeout.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta