Een bedrijf verzamelt gegevens uit vele bronnen in een S3-bucket, voert een AWS Glue ETL-taak uit om deze te transformeren, en slaat de getransformeerde uitvoer op in een S3-gebaseerd data lake dat wordt bevraagd door Amazon Athena. Het bedrijf moet overeenkomende records identificeren, zelfs als er geen gedeelde unieke identificatie is. Welke oplossing zal dit bewerkstelligen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Train en gebruik de AWS Lake Formation FindMatches transformatie in de ETL-taak..
Waarom dit het antwoord is
De AWS Lake Formation FindMatches-transformatie is specifiek ontworpen voor het identificeren van overeenkomende records in datasets, zelfs wanneer er geen gemeenschappelijke unieke identificatie bestaat. Het gebruikt machine learning om records te koppelen op basis van vergelijkbare, maar niet identieke, attributen. Dit is precies wat het bedrijf nodig heeft om records te dedupliceren of te koppelen uit verschillende bronnen. Amazon Macie is gericht op gegevensbeveiliging en het ontdekken van gevoelige gegevens, niet op het matchen van records zonder unieke ID's. De AWS Glue PySpark Filter-klasse is voor het filteren van rijen op basis van specifieke voorwaarden, niet voor geavanceerde matching. Het partitioneren van tabellen op een unieke identificatie is nuttig voor queryprestaties en organisatie, maar lost het probleem van het matchen van records zonder een gedeelde unieke ID niet op.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig