Un'azienda sta costruendo un data lake su Amazon S3 e deve applicare controlli di accesso a livello di riga e a livello di colonna per i team che eseguiranno query tramite Amazon Athena, Redshift Spectrum e Apache Hive su EMR. Quale approccio riduce al minimo l'overhead operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Utilizzare Amazon S3 per l'archiviazione del data lake. Utilizzare AWS Lake Formation per limitare l'accesso ai dati per righe e colonne. Fornire l'accesso ai dati tramite AWS Lake Formation..
Perché questa è la risposta
L'approccio corretto prevede l'utilizzo di AWS Lake Formation perché è un servizio gestito progettato specificamente per la creazione, la protezione e la gestione di data lake su Amazon S3. Offre controlli di accesso a livello di riga e di colonna granulari che si integrano nativamente con Amazon Athena, Redshift Spectrum e Apache Hive su EMR, riducendo al minimo l'overhead operativo. Le altre opzioni sono meno efficienti o non adatte: Le policy di accesso S3 non supportano nativamente il controllo degli accessi a livello di riga e colonna per i dati strutturati. Apache Ranger su EMR è una soluzione valida ma introduce un maggiore overhead operativo rispetto a Lake Formation, essendo necessaria la gestione del cluster EMR e di Ranger stesso. Inoltre, l'utilizzo di Apache Pig per l'accesso ai dati è meno flessibile rispetto agli altri servizi menzionati. Utilizzare Amazon Redshift per l'archiviazione del data lake è errato, poiché Redshift è un data warehouse, non un data lake. Il data lake è su S3.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta