Un ingegnere ML deve elaborare migliaia di file CSV esistenti più nuovi caricamenti CSV archiviati in un bucket S3 centrale. Tutti i CSV condividono lo stesso layout di colonna e includono una colonna di data di transazione che deve essere interrogata. Quale soluzione offre questo con il minor overhead operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Eseguire un Amazon Athena CREATE TABLE AS SELECT (CTAS) per creare una tabella (partizionata o filtrata per data di transazione) sui dati S3, quindi interrogare quella tabella..
Perché questa è la risposta
L'opzione corretta è la più efficiente perché Amazon Athena consente di interrogare direttamente i dati in S3 utilizzando SQL standard, senza la necessità di spostare o trasformare i dati. L'uso di CREATE TABLE AS SELECT (CTAS) con partizionamento per data di transazione ottimizza le query future, riducendo i dati scansionati e i costi. Le altre opzioni introducono overhead operativi non necessari: replicare dati in un nuovo bucket con S3 Object Lambda aggiunge complessità e costi di gestione; un job AWS Glue per Apache Spark è eccessivo per una semplice interrogazione e scrittura, richiedendo la gestione di un cluster; Kinesis Data Firehose è pensato per lo streaming di dati in tempo reale, non per l'interrogazione di dati esistenti, e l'uso di una funzione Lambda per filtrare sarebbe inefficiente rispetto ad Athena.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta