Un ingegnere dei dati ha la necessità occasionale di leggere oggetti Apache Parquet in un bucket S3 ed estrarre una sola colonna. Quale opzione raggiunge questo obiettivo con un sovraccarico operativo minimo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare S3 Select per scrivere un'istruzione SQL SELECT per recuperare la colonna richiesta dagli oggetti S3..
Perché questa è la risposta
L'opzione corretta è utilizzare S3 Select perché consente di recuperare solo i dati necessari da un oggetto Parquet direttamente in S3 tramite query SQL, riducendo significativamente il sovraccarico operativo e i costi di trasferimento dati. Le altre opzioni presentano svantaggi: Una funzione AWS Lambda che carica l'intero oggetto Parquet in un dataframe pandas è inefficiente per estrarre una singola colonna, consumando più memoria e tempo di esecuzione. AWS Glue DataBrew è uno strumento di preparazione dati più complesso, eccessivo per la semplice estrazione di una colonna, e richiede la configurazione di un progetto. Eseguire un crawler AWS Glue e poi interrogare con Amazon Athena è una soluzione valida per query più complesse o su dataset più ampi, ma introduce un sovraccarico maggiore (crawler, catalogo dati) rispetto a S3 Select per il caso d'uso specifico di estrazione di una singola colonna.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta