Een bedrijf extraheert ongeveer 1 TB aan gegevens per dag uit bronnen zoals SAP HANA, SQL Server, MongoDB, Kafka en DynamoDB. Sommige bronnen hebben ongedefinieerde of evoluerende schema's. De oplossing moet schema's detecteren, ETL uitvoeren en de gegevens binnen 15 minuten na het aanmaken in S3 laden. Welke aanpak biedt de vereiste functionaliteit met de minste operationele overhead?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Gebruik AWS Glue om het schema te detecteren en de gegevens te extraheren, transformeren en laden in de S3-bucket. Maak een pipeline in Apache Spark..
Waarom dit het antwoord is
AWS Glue is de meest geschikte oplossing omdat het een serverloze ETL-service is die speciaal is ontworpen voor het detecteren van schema's (met behulp van Glue Crawlers) en het uitvoeren van ETL-taken, inclusief ondersteuning voor ongestructureerde en semi-gestructureerde gegevens. Het kan naadloos integreren met diverse databronnen zoals SAP HANA, SQL Server, MongoDB, Kafka en DynamoDB, en biedt ingebouwde Apache Spark-ondersteuning voor schaalbare dataverwerking. Dit minimaliseert de operationele overhead aanzienlijk in vergelijking met het zelf beheren van EMR-clusters. Amazon EMR vereist het beheer van clusters, wat meer operationele overhead met zich meebrengt dan de serverloze aanpak van AWS Glue. AWS Lambda is niet geschikt voor het verwerken van 1 TB aan gegevens per dag binnen 15 minuten vanwege de beperkingen in uitvoeringstijd en geheugen. Amazon Redshift is een datawarehouse en hoewel Redshift Spectrum toegang biedt tot S3-gegevens, is het primaire doel niet het detecteren van schema's of het uitvoeren van ETL-taken vanuit diverse bronnen naar S3; het is meer gericht op analyse.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig