Een bedrijf migreert een legacy-applicatie naar een S3-gebaseerd data lake. De legacy-data bevat dubbele records. De data engineer moet duplicaten identificeren en verwijderen met de MINSTE operationele overhead. Welke oplossing moet de engineer kiezen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Schrijf een AWS Glue extract, transform, and load (ETL) job. Gebruik de FindMatches machine learning (ML) transform om de data te transformeren en data-deduplicatie uit te voeren..
Waarom dit het antwoord is
De correcte optie is het gebruik van een AWS Glue ETL-taak met de FindMatches ML-transformatie. FindMatches is specifiek ontworpen voor het identificeren van dubbele of overeenkomende records, zelfs als ze niet exact identiek zijn, en vereist minimale operationele overhead omdat het een beheerde service is. Het is geoptimaliseerd voor dit soort taken en kan worden getraind op basis van voorbeelden. Aangepaste Python ETL-jobs met Pandas of de Python dedupe-bibliotheek vereisen meer operationele overhead voor het beheer van de infrastructuur en de code. Hoewel Pandas dropduplicates() effectief is voor exacte duplicaten, is FindMatches beter voor "fuzzy matching". Het importeren van de Python dedupe-bibliotheek in een Glue-job is technisch mogelijk, maar FindMatches biedt een meer geïntegreerde en geoptimaliseerde oplossing binnen het AWS-ecosysteem voor deze specifieke uitdaging.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig