Een bedrijf ontvangt dagelijks een .xls-bestand van ongeveer 2 GB in S3 met klantgegevens. Een data-engineer voegt de kolommen voor voornaam en achternaam samen en moet het aantal unieke klanten in het bestand tellen. Welke aanpak vereist de minste operationele inspanning?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik AWS Glue DataBrew om een recept te maken dat de COUNT_DISTINCT-aggregatiefunctie gebruikt om het aantal unieke klanten te berekenen..
Waarom dit het antwoord is
AWS Glue DataBrew is een visuele tool voor gegevensvoorbereiding zonder code, ideaal voor het transformeren en opschonen van gegevens. Het maken van een recept met de COUNTDISTINCT-aggregatiefunctie is een eenvoudige en efficiënte manier om het aantal unieke klanten te tellen zonder code te schrijven of infrastructuur te beheren, wat resulteert in de minste operationele inspanning. Het uitvoeren van een Apache Spark-taak in een AWS Glue-notebook of Amazon EMR Serverless vereist het schrijven en onderhouden van code, wat meer operationele inspanning met zich meebrengt. Het gebruik van een AWS Glue crawler en Amazon Athena is een goede optie voor ad-hoc query's, maar voor een herhaalbare transformatie zoals deze, biedt DataBrew een gestroomlijndere, minder operationele oplossing.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig