Un'azienda raccoglie dati da molte fonti in un bucket S3, esegue un job AWS Glue ETL per trasformarli e archivia l'output trasformato in un data lake basato su S3 interrogato da Amazon Athena. L'azienda deve identificare i record corrispondenti anche quando non esiste un identificatore univoco condiviso. Quale soluzione consentirà di raggiungere questo obiettivo?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Addestrare e utilizzare la trasformazione AWS Lake Formation FindMatches nel job ETL..
Perché questa è la risposta
La trasformazione AWS Lake Formation FindMatches è la soluzione corretta perché è specificamente progettata per identificare record corrispondenti (deduplicazione o collegamento di record) anche in assenza di un identificatore univoco. Utilizza il machine learning per apprendere i modelli di corrispondenza dai dati forniti, consentendo di trovare record che si riferiscono alla stessa entità anche con lievi variazioni o dati mancanti. Le altre opzioni non sono adatte: La corrispondenza di pattern di Amazon Macie è utilizzata principalmente per la scoperta e la protezione di dati sensibili, non per la corrispondenza di record generica. La classe AWS Glue PySpark Filter è per filtrare i dati in base a condizioni specificate, non per identificare record corrispondenti senza un ID univoco. Partizionare le tabelle e partizionare i dati su un identificatore univoco presuppone l'esistenza di un identificatore univoco, che il problema dichiara non essere disponibile.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta