Een data scientist moet ongeveer 500 GB aan historische inventarisgegevens, opgeslagen als CSV-bestanden in een Amazon S3 data lake, verkennen. Ze willen SQL gebruiken voor exploratie en het bedrijf wil de kosten en operationele overhead minimaliseren. Welke aanpak voldoet aan deze vereisten met de minste operationele beheerinspanning?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: AWS Glue gebruiken om de S3-bucket te crawlen en de AWS Glue Data Catalog te vullen, en vervolgens de gegevens opvragen met Amazon Athena..
Waarom dit het antwoord is
De correcte optie is het meest kosteneffectief en vereist de minste operationele overhead. AWS Glue crawlt de S3-bestanden en vult de AWS Glue Data Catalog met schema-informatie, waardoor de gegevens direct queryable zijn via Amazon Athena. Athena is een serverloze queryservice die SQL gebruikt om gegevens direct in S3 te analyseren, wat betekent dat er geen infrastructuur hoeft te worden geprovisioneerd of beheerd. De andere opties zijn minder optimaal: Een Amazon EMR-cluster provisioneren introduceert operationele overhead voor het beheer van het cluster. Het provisioneren van een Amazon Redshift-cluster brengt hogere kosten en operationele overhead met zich mee, zowel voor het cluster zelf als voor het laden van gegevens. Zelfs met externe tabellen in Redshift Spectrum betaalt u nog steeds voor het Redshift-cluster.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig