Een ML-engineer moet wekelijkse gegevens uit twee bronnen samenvoegen en transformeren: grote CSV-bestanden in S3 (elk met miljoenen rijen) en een Amazon Aurora-cluster. De samengevoegde uitvoer moet naar een andere S3-bucket worden geschreven. Welke optie biedt dit met de MINSTE operationele overhead?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Een wekelijkse AWS Glue-taak plannen met de Apache Spark-engine en DynamicFrame-bewerkingen gebruiken om de gegevens samen te voegen en te transformeren..
Waarom dit het antwoord is
De correcte optie is het plannen van een wekelijkse AWS Glue-taak. AWS Glue is een serverloze ETL-service (Extract, Transform, Load) die specifiek is ontworpen voor het verwerken van grote datasets, zoals de miljoenen rijen in S3 CSV-bestanden en gegevens uit Amazon Aurora. Het gebruikt Apache Spark als engine en biedt DynamicFrames voor efficiënte gegevensmanipulatie, wat de operationele overhead minimaliseert doordat u geen servers hoeft te provisioneren of te beheren. Het provisioneren van een tijdelijk Amazon EMR-cluster vereist meer operationele overhead voor het opzetten en configureren van het cluster. Een AWS Lambda-functie is niet geschikt voor het uitvoeren van Apache Spark-code op grote datasets vanwege de beperkingen in looptijd en geheugen. AWS Batch op EC2-instanties biedt weliswaar flexibiliteit, maar vereist meer beheer van de onderliggende infrastructuur dan AWS Glue.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig