Un ingegnere dei dati ha configurato un crawler AWS Glue per catalogare i dati in un bucket S3 che contiene sia file .csv che .json. Il crawler è stato impostato per escludere i file .json, ma durante l'esecuzione delle query Athena i file .json vengono comunque elaborati. L'ingegnere deve risolvere il problema senza modificare l'accesso ai file .csv e desidera i tempi di query più brevi possibili. Qual è la soluzione migliore?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Spostare i file .json in un percorso diverso all'interno del bucket S3..
Perché questa è la risposta
Spostare i file .json in un percorso diverso all'interno del bucket S3 è la soluzione migliore perché AWS Glue Crawler cataloga i dati in base al percorso. Se i file .json sono nello stesso percorso dei file .csv, anche se esclusi dal crawler, Athena potrebbe comunque tentare di elaborarli se la tabella Glue è stata creata con un puntatore alla directory padre. Spostando i file .json, si garantisce che Athena non li includa nelle query sulla tabella .csv, migliorando i tempi di query. Modificare le impostazioni del crawler AWS Glue non risolve il problema se i file .json sono già stati catalogati o se Athena punta alla directory padre. Utilizzare la console Athena per escludere i file .json richiederebbe modifiche a ogni query, il che non è efficiente. Utilizzare le policy del bucket S3 per bloccare l'accesso ai file .json impedirebbe l'accesso anche per altri scopi legittimi e non è la soluzione più granulare per la gestione delle query.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta