Une entreprise extrait environ 1 To de données par jour de sources telles que SAP HANA, SQL Server, MongoDB, Kafka et DynamoDB. Certaines sources ont des schémas non définis ou évolutifs. La solution doit détecter les schémas, effectuer l'ETL et charger les données dans S3 dans les 15 minutes suivant leur création. Quelle approche offre les fonctionnalités requises avec le moins de frais opérationnels ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser AWS Glue pour détecter le schéma et pour extraire, transformer et charger les données dans le compartiment S3. Créer un pipeline dans Apache Spark..
Pourquoi c'est la réponse
AWS Glue est un service ETL sans serveur qui s'intègre nativement avec de nombreuses sources de données, y compris celles mentionnées. Il excelle dans la détection de schémas pour les données structurées et semi-structurées, ce qui est crucial pour les schémas non définis ou évolutifs. Sa capacité à exécuter des tâches Apache Spark permet un traitement rapide et évolutif, répondant à l'exigence de 15 minutes pour 1 To de données, tout en minimisant les frais opérationnels grâce à son architecture sans serveur. Amazon EMR nécessiterait la gestion des clusters, augmentant les frais opérationnels. AWS Lambda n'est pas adapté pour le traitement de 1 To de données en 15 minutes en raison de ses limitations de temps d'exécution et de mémoire. Une procédure stockée Redshift n'est pas conçue pour l'ingestion et la transformation de données provenant de sources externes variées vers S3, et Redshift Spectrum est utilisé pour interroger des données sur S3, non pour l'ETL.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise