Een bedrijf heeft een grote ongestructureerde dataset die veel dubbele records bevat over belangrijke attributen. Welke AWS-oplossing zal duplicaten identificeren met de minste hoeveelheid aangepaste code?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik de AWS Glue FindMatches transform om dubbele records te identificeren..
Waarom dit het antwoord is
De AWS Glue FindMatches transform is ontworpen voor het identificeren van dubbele of overeenkomende records in datasets, zelfs als er geen exacte overeenkomst is. Het gebruikt machine learning om te leren hoe records overeenkomen, wat het zeer effectief maakt voor ongestructureerde gegevens met variaties. Dit vereist de minste aangepaste code. Amazon Mechanical Turk is een crowdsourcing-dienst die handmatige arbeid vereist en niet de meest efficiënte of schaalbare oplossing is voor grote datasets. Amazon QuickSight ML Insights is gericht op het genereren van inzichten en het bouwen van ML-modellen voor analyse, niet primair voor datadeduplicatie. Amazon SageMaker Data Wrangler is een tool voor gegevensvoorbereiding en -engineering, maar de FindMatches transform in AWS Glue is specifiek geoptimaliseerd voor het identificeren van dubbele records met behulp van ML.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig