Un ingénieur ML doit fusionner et transformer des données hebdomadaires provenant de deux sources : de grands fichiers CSV dans S3 (chacun contenant des millions de lignes) et un cluster Amazon Aurora. Le résultat fusionné doit être écrit dans un autre compartiment S3. Quelle option offre cela avec le MOINS de frais opérationnels ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Planifier un job AWS Glue hebdomadaire utilisant le moteur Apache Spark et utiliser les opérations DynamicFrame pour fusionner et transformer les données..
Pourquoi c'est la réponse
L'option AWS Glue est la plus efficace pour ce scénario car elle est un service ETL sans serveur et entièrement géré. Elle élimine les frais opérationnels liés à la gestion de l'infrastructure (serveurs, clusters), ce qui est requis par EMR, AWS Batch et même Lambda pour des tâches Spark complexes. AWS Glue utilise Apache Spark en arrière-plan et ses DynamicFrames simplifient la manipulation des données structurées et semi-structurées, ce qui est idéal pour fusionner des CSV et des données Aurora. EMR nécessite le provisionnement et la gestion d'un cluster. Lambda n'est pas adapté pour exécuter des jobs Spark de cette ampleur en raison de ses limitations de temps d'exécution et de ressources. AWS Batch nécessiterait la configuration et la gestion d'instances EC2 et de l'environnement Spark.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise