Een investeringsmaatschappij verwerkt een steeds groter wordend volume aan semi-gestructureerde data en moet records dedupliceren, waarbij duplicaten en veelvoorkomende spelfouten worden verwijderd. Welke optie biedt deze mogelijkheid met de minste operationele overhead?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik de FindMatches-functie van AWS Glue om dubbele records te verwijderen..
Waarom dit het antwoord is
De FindMatches-functie van AWS Glue is specifiek ontworpen voor het identificeren en dedupliceren van records, zelfs wanneer er geen exacte overeenkomsten zijn, zoals bij spelfouten. Dit wordt bereikt met behulp van machine learning, wat de operationele overhead minimaliseert omdat het geen complexe handmatige regels of scripts vereist. Niet-Window-functies in Amazon Athena zijn geschikt voor exacte duplicaten, maar niet voor spelfouten of bijna-overeenkomsten. Amazon Neptune ML en Apache Gremlin zijn bedoeld voor grafiekdata en relatie-analyse, niet voor het dedupliceren van semi-gestructureerde records met spelfouten. De global tables-functie van Amazon DynamoDB is voor het repliceren van data over regio's en voorkomt geen duplicaten binnen een dataset.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig