Une entreprise de services financiers construit un lac de données sans serveur sur Amazon S3 qui doit : permettre d'interroger les données S3 anciennes et nouvelles avec Amazon Athena et Redshift Spectrum, prendre en charge les pipelines ETL basés sur les événements et faciliter la découverte des métadonnées. Quelle solution répond à ces exigences ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser un crawler AWS Glue pour cataloguer les données S3, déclencher des tâches ETL AWS Glue avec AWS Lambda et utiliser l'AWS Glue Data Catalog pour la découverte des métadonnées..
Pourquoi c'est la réponse
Cette solution est correcte car AWS Glue Data Catalog est un metastore Apache Hive compatible qui permet à Athena et Redshift Spectrum d'interroger les données sur S3. Les crawlers AWS Glue découvrent automatiquement les schémas et les partitions des données, mettant à jour le Data Catalog. AWS Lambda peut déclencher des tâches ETL AWS Glue en réponse à des événements (par exemple, de nouvelles données arrivant sur S3), ce qui est essentiel pour les pipelines basés sur les événements. Le Data Catalog facilite également la découverte des métadonnées. Les autres options sont incorrectes car : L'utilisation d'un metastore Apache Hive externe introduit une complexité de gestion inutile et ne s'intègre pas aussi nativement avec Athena et Redshift Spectrum que le Glue Data Catalog. Déclencher des tâches AWS Batch ou des tâches ETL via des alarmes CloudWatch n'est pas la méthode la plus appropriée pour des pipelines ETL basés sur les événements, où Lambda est plus adapté pour réagir aux changements de données.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise