Je moet verkennende data-analyse (EDA) uitvoeren op een petabyte-schaal dataset, zonder de clusterinfrastructuur te beheren, alleen te betalen voor de queries die je uitvoert, en de analyse in Python te schrijven vanuit een Jupyter notebook. Welke oplossing voldoet aan deze beperkingen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Voer Apache Spark uit vanuit Amazon Athena..
Waarom dit het antwoord is
De juiste optie is het uitvoeren van Apache Spark vanuit Amazon Athena. Amazon Athena is een serverloze queryservice die het mogelijk maakt om petabyte-schaal data te analyseren met standaard SQL, en nu ook met Apache Spark. Dit voldoet aan de eis om geen clusterinfrastructuur te beheren en alleen te betalen voor de uitgevoerde queries. Bovendien kan Athena worden geïntegreerd met Jupyter notebooks, wat de analyse in Python mogelijk maakt. Het uitvoeren van Apache Spark vanuit Amazon SageMaker is mogelijk, maar SageMaker is primair een machine learning platform en niet geoptimaliseerd voor serverloze data-analyse tegen lage kosten. Het uitvoeren van Apache Spark op een Amazon EMR-cluster vereist het provisioneren en beheren van infrastructuur, wat in strijd is met de eis. Het gebruik van Apache Spark geïntegreerd met Amazon Redshift is ook niet ideaal, aangezien Redshift een datawarehouse is en niet primair een serverloze queryservice voor ruwe data, en het beheer van Redshift-clusters is ook vereist.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig