Vous devez effectuer une analyse exploratoire de données (EDA) sur un ensemble de données à l'échelle du pétaoctet, sans gérer l'infrastructure de cluster, en ne payant que pour les requêtes que vous exécutez et en écrivant l'analyse en Python à partir d'un bloc-notes Jupyter. Quelle solution satisfait ces contraintes ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Exécuter Apache Spark depuis Amazon Athena..
Pourquoi c'est la réponse
La bonne réponse est d'exécuter Apache Spark depuis Amazon Athena. Amazon Athena permet d'exécuter des requêtes Spark sur des données stockées dans Amazon S3 sans provisionner ni gérer de serveurs, ce qui répond aux exigences de ne pas gérer l'infrastructure et de payer uniquement pour les requêtes exécutées. De plus, Athena peut être intégré à des notebooks Jupyter pour l'analyse en Python. Les autres options sont incorrectes car : Exécuter Apache Spark depuis Amazon SageMaker nécessiterait la gestion de l'instance SageMaker et ne serait pas aussi optimisé pour le paiement à la requête sur des ensembles de données à l'échelle du pétaoctet sans gestion d'infrastructure pour Spark lui-même. Exécuter Apache Spark sur un cluster Amazon EMR que vous provisionnez contredit l'exigence de ne pas gérer l'infrastructure de cluster, car EMR est un service géré mais nécessite la configuration et la gestion des clusters. Utiliser Apache Spark intégré à Amazon Redshift n'est pas une fonctionnalité native de Redshift pour l'EDA sur des ensembles de données à l'échelle du pétaoctet sans gestion de cluster Spark distincte. Redshift est un entrepôt de données et non un moteur Spark sans serveur.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise