Je moet twee datasets – klantorders en productcatalogusbeschrijvingen – samenvoegen die verschillende structuren en formaten hebben, waarbij vergelijkbare records worden gematcht en duplicaten worden verwijderd. Welke oplossing is het meest geschikt voor het matchen en opschonen van deze gegevens?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Voer AWS Glue crawlers uit om de Glue Data Catalog te vullen en gebruik de Glue FindMatches transform om vergelijkbare records te identificeren en de gegevens te dedupliceren..
Waarom dit het antwoord is
De Glue FindMatches transform is ontworpen voor het identificeren van vergelijkbare, maar niet identieke, records in datasets zonder een gemeenschappelijke sleutel, wat essentieel is voor het matchen van klantorders en productcatalogusbeschrijvingen met verschillende structuren. Het kan ook duplicaten verwijderen. AWS Glue crawlers vullen de Glue Data Catalog, wat een vereiste is voor het gebruik van Glue FindMatches. Een Lambda-functie zou te complex en inefficiënt zijn voor grote datasets en fuzzy matching. De Glue SearchTables API is bedoeld voor het zoeken in de Data Catalog, niet voor fuzzy matching en deduplicatie van gegevens zelf. Lake Formation custom transforms zijn voor het beheren van toegang en transformaties op een data lake, niet specifiek voor dit type geavanceerde matching en deduplicatie.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig