Un'azienda esegue analisi trimestrali dei dati in un data lake per eseguire controlli di inventario. Un ingegnere dei dati utilizza AWS Glue DataBrew per trovare qualsiasi informazione di identificazione personale (PII) sui clienti nei dati. Le regole sulla privacy dell'azienda includono alcune categorie PII personalizzate che non fanno parte delle regole di qualità dei dati integrate di DataBrew. L'ingegnere deve aggiornare il processo per la scansione di queste categorie PII personalizzate su molti set di dati nel data lake. Quale approccio soddisfa il requisito con il minor overhead operativo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Creare regole di qualità dei dati personalizzate in DataBrew e applicarle ai set di dati..
Perché questa è la risposta
La creazione di regole di qualità dei dati personalizzate in DataBrew è l'approccio più efficiente perché DataBrew è progettato per la pulizia e la trasformazione dei dati, inclusa la rilevazione PII. Le regole personalizzate possono essere riutilizzate su più set di dati con un sovraccarico operativo minimo, integrandosi perfettamente nel flusso di lavoro esistente. L'esame manuale è inefficiente e soggetto a errori. Gli script Python personalizzati aumentano il sovraccarico di sviluppo e manutenzione. L'uso di espressioni regolari durante l'ETL è possibile, ma DataBrew offre un'interfaccia più user-friendly e funzionalità specifiche per la qualità dei dati, rendendolo più adatto a questo scenario.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta