Vous disposez de données de capteurs de sol IoT dans une table Amazon DynamoDB de 10 Go et de données d'événements météorologiques sous forme de fichiers JSON de 5 Go dans Amazon S3. Vous souhaitez préparer cet ensemble de données combiné pour entraîner un modèle Amazon SageMaker avec le moins de frais d'administration possible. Quelle approche permet le mieux d'accomplir la transformation requise ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Exécuter des crawlers AWS Glue pour cataloguer les données. Créer un job ETL AWS Glue qui fusionne les jeux de données DynamoDB et S3 et écrit la sortie fusionnée sous forme de fichiers CSV dans Amazon S3..
Pourquoi c'est la réponse
L'approche correcte utilise AWS Glue, un service ETL sans serveur, pour minimiser les frais d'administration. Les crawlers AWS Glue découvrent automatiquement le schéma des données dans DynamoDB et S3, les cataloguant dans le AWS Glue Data Catalog. Ensuite, un job ETL AWS Glue peut facilement fusionner ces jeux de données et écrire la sortie transformée au format CSV dans S3, un format idéal pour l'entraînement de modèles SageMaker. Démarrer un cluster Amazon EMR implique une gestion d'infrastructure, ce qui augmente les frais d'administration. Écrire la sortie dans Amazon Redshift n'est pas l'option la plus rentable si l'objectif principal est de préparer les données pour SageMaker, car Redshift est un entrepôt de données analytique. Utiliser DynamoDB Streams avec une fonction Lambda pour fusionner les données est inefficace pour des volumes de données historiques de 15 Go et ne gère pas la fusion des données S3 de manière optimale.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise