Un scientifique des données doit explorer environ 500 Go de données d'inventaire historiques stockées sous forme de fichiers CSV dans un lac de données Amazon S3. Il souhaite utiliser SQL pour l'exploration et l'entreprise veut minimiser les coûts et la charge opérationnelle. Quelle approche répond à ces exigences avec le moins de gestion opérationnelle ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser AWS Glue pour crawler le bucket S3 et remplir l'AWS Glue Data Catalog, puis interroger les données avec Amazon Athena..
Pourquoi c'est la réponse
L'utilisation d'AWS Glue pour cataloguer les données et d'Amazon Athena pour les interroger est la solution la plus rentable et la moins opérationnelle. Athena est un service sans serveur qui permet d'exécuter des requêtes SQL directement sur les données S3 sans provisionner ni gérer d'infrastructure. AWS Glue Data Catalog fournit un metastore centralisé pour les schémas. Provisionner un cluster Amazon EMR ou Amazon Redshift implique la gestion de serveurs, ce qui augmente la charge opérationnelle et les coûts. Bien que Redshift Spectrum permette d'interroger des données S3 externes, le provisionnement d'un cluster Redshift est plus coûteux et plus complexe que l'approche sans serveur d'Athena pour l'exploration ad hoc.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise