È necessario unire due set di dati (ordini dei clienti e descrizioni del catalogo prodotti) che hanno strutture e formati diversi, abbinando record simili e rimuovendo i duplicati. Qual è la soluzione più appropriata per l'abbinamento e la pulizia di questi dati?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Eseguire i crawler AWS Glue per popolare il Glue Data Catalog e utilizzare la trasformazione Glue FindMatches per identificare record simili e deduplicare i dati..
Perché questa è la risposta
La trasformazione AWS Glue FindMatches è progettata specificamente per identificare record duplicati o simili in set di dati con strutture e formati diversi, anche quando non esiste un identificatore univoco. Utilizza il machine learning per apprendere i modelli di corrispondenza e deduplicare i dati in modo efficace. I crawler AWS Glue sono essenziali per popolare il Glue Data Catalog, che FindMatches utilizza per accedere e comprendere i metadati dei set di dati. Le altre opzioni sono meno appropriate: Una funzione AWS Lambda con confronti di stringhe e array sarebbe inefficiente e inefficace per set di dati complessi e grandi, non gestendo la corrispondenza fuzzy o le variazioni nei dati. L'API Glue SearchTables serve per cercare tabelle nel Data Catalog, non per la corrispondenza fuzzy o la pulizia dei dati. AWS Lake Formation si concentra sulla gestione della sicurezza e dell'accesso ai dati nei data lake, non offre una trasformazione di corrispondenza integrata come FindMatches per la deduplicazione basata sul machine learning.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta