Un ingegnere ML deve costruire una pipeline che utilizzi Amazon Athena per due carichi di lavoro: trasformazioni batch su larga scala e addestramento di modelli, e query a bassa latenza quasi in tempo reale per inferenza e analisi. Quale formato di file produrrà la latenza PIÙ BASSA sia per l'elaborazione batch che per quella quasi in tempo reale?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Apache Parquet.
Perché questa è la risposta
Apache Parquet è un formato di archiviazione colonnare ottimizzato per query analitiche e carichi di lavoro di machine learning. La sua natura colonnare consente a Athena di leggere solo le colonne necessarie per una query, riducendo significativamente la quantità di dati scansionati e, di conseguenza, la latenza sia per le trasformazioni batch che per le query quasi in tempo reale. Offre anche un'ottima compressione e codifica efficiente. CSV (Comma Separated Values) è un formato basato su righe, il che significa che Athena deve leggere l'intera riga anche se sono necessarie solo alcune colonne, aumentando la latenza e i costi. Nested JSON e Deserialized JSON sono anch'essi formati basati su righe e, sebbene utili per dati semi-strutturati, non offrono le stesse prestazioni di query e compressione di Parquet per carichi di lavoro analitici e di ML su larga scala.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta