Un'azienda partiziona il suo data lake Amazon S3 utilizzando percorsi di chiavi oggetto come s3://bucket/prefix/year=2023/month=01/day=01. L'AWS Glue Data Catalog deve rimanere sincronizzato con S3 quando vengono aggiunte nuove partizioni. Quale approccio offre la latenza più bassa per mantenere aggiornato il catalogo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare codice che scrive dati su Amazon S3 per richiamare la chiamata API Boto3 AWS Glue create_partition..
Perché questa è la risposta
L'approccio più efficiente per mantenere il Glue Data Catalog sincronizzato con la latenza più bassa è utilizzare il codice che scrive i dati su Amazon S3 per richiamare contestualmente l'API Boto3 createpartition di AWS Glue. Questo garantisce che ogni nuova partizione venga registrata nel catalogo non appena viene creata in S3, minimizzando il ritardo. Pianificare un crawler AWS Glue ogni mattina introdurrebbe una latenza significativa (fino a 24 ore), poiché il catalogo verrebbe aggiornato solo una volta al giorno. Eseguire manualmente l'API CreatePartition due volte al giorno è un processo manuale e non scalabile, soggetto a errori e con latenza maggiore rispetto all'aggiornamento programmatico. Il comando MSCK REPAIR TABLE (o ALTER TABLE RECOVER PARTITIONS) è utile per recuperare partizioni esistenti ma non registrate, ma non offre la latenza più bassa per l'aggiunta continua di nuove partizioni, in quanto deve essere eseguito attivamente e scansiona l'intero percorso della tabella.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta