Un'azienda ha una cartella S3 che contiene tipi di file misti (CSV, JSON, XLSX e Apache Parquet). Un ingegnere ML utilizzerà AWS Glue DataBrew per elaborare i dati e deve salvare l'output finale su S3 in modo che AWS Glue possa consumarlo in seguito. Quale approccio soddisfa questi requisiti?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Separare i file in cartelle distinte per tipo di file, elaborare ogni cartella con DataBrew e scrivere gli output in formato Apache Parquet..
Perché questa è la risposta
L'opzione corretta è "Separare i file in cartelle distinte per tipo di file, elaborare ogni cartella con DataBrew e scrivere gli output in formato Apache Parquet." Questo perché AWS Glue DataBrew è progettato per lavorare con un tipo di file alla volta per un set di dati specifico. Per elaborare tipi di file misti in una singola cartella, è necessario separarli per garantire che DataBrew possa applicare correttamente gli schemi e le trasformazioni appropriate a ciascun tipo di dati. Il formato Apache Parquet è una scelta eccellente per l'output finale poiché è un formato colonnare ottimizzato per l'analisi e l'elaborazione da parte di servizi come AWS Glue, offrendo prestazioni migliori e costi inferiori rispetto ad altri formati. Le opzioni che suggeriscono di elaborare la cartella S3 esistente direttamente con tipi di file misti sono errate perché DataBrew non gestisce efficacemente set di dati con formati di file eterogenei senza una previa separazione. Le opzioni che menzionano "AWS Glue Parquet" sono imprecise, poiché il formato standard e ampiamente riconosciuto è Apache Parquet, che è pienamente compatibile e ottimizzato per AWS Glue.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta