Un'azienda sta migrando un'applicazione legacy verso un data lake basato su S3. I dati legacy contengono record duplicati. L'ingegnere dei dati deve identificare e rimuovere i duplicati con il MINOR overhead operativo. Quale soluzione dovrebbe scegliere l'ingegnere?
Scegli una risposta
Tocca un'opzione per controllare la tua risposta.
Risposta corretta: Scrivere un job di extract, transform, and load (ETL) di AWS Glue. Utilizzare la trasformazione di machine learning (ML) FindMatches per trasformare i dati ed eseguire la deduplicazione dei dati..
Perché questa è la risposta
La soluzione corretta è utilizzare un job AWS Glue ETL con la trasformazione ML FindMatches. AWS Glue è un servizio ETL serverless che riduce al minimo l'overhead operativo. FindMatches è specificamente progettato per identificare record duplicati o corrispondenti anche quando non c'è una corrispondenza esatta, il che è comune nei dati legacy. Questo approccio è efficiente e richiede una configurazione minima rispetto allo sviluppo di logiche di deduplicazione personalizzate. Le altre opzioni comportano un overhead maggiore: Scrivere un job ETL personalizzato in Python con Pandas o la libreria dedupe richiede la gestione dell'infrastruttura di calcolo e lo sviluppo manuale della logica di deduplicazione, aumentando l'overhead operativo. Importare la libreria dedupe in un job AWS Glue è possibile, ma FindMatches è una soluzione nativa e ottimizzata per Glue che offre funzionalità ML per la deduplicazione fuzzy, spesso più efficace e con meno sforzo di configurazione rispetto a una libreria generica.
Supera il tuo esame — senza l'infinita caccia alle risposte
Ottieni ogni domanda e spiegazione verificata per questo esame in un unico posto, e risparmia ore di preparazione. Oltre 1.000 certificazioni · Oltre 20 lingue · Inizia gratuitamente.
Supera il tuo esame più velocemente → Nessuna carta richiesta