Une entreprise reçoit quotidiennement un fichier .xls d'environ 2 Go dans S3 contenant des données client. Un ingénieur de données concatène les colonnes de prénom et de nom de famille et doit compter le nombre de clients distincts dans le fichier. Quelle approche nécessite le moins d'effort opérationnel ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser AWS Glue DataBrew pour créer une recette qui utilise la fonction d'agrégation COUNT_DISTINCT pour calculer le nombre de clients distincts..
Pourquoi c'est la réponse
AWS Glue DataBrew est un service sans serveur et visuel de préparation de données qui permet de nettoyer et de normaliser les données sans écrire de code. Pour un fichier de 2 Go et une tâche simple comme la concaténation de colonnes et le comptage distinct, DataBrew offre la solution la plus rapide et la moins exigeante en termes d'effort opérationnel grâce à son interface utilisateur graphique et ses transformations prédéfinies. Les autres options nécessitent plus d'effort opérationnel ou de développement : Un job Apache Spark dans AWS Glue (notebook ou EMR Serverless) implique l'écriture de code Spark, ce qui est plus complexe pour une tâche simple. Un crawler AWS Glue avec Amazon Athena est une bonne approche pour l'exploration et l'interrogation ad-hoc, mais DataBrew est plus direct pour la préparation et la transformation de données spécifiques sans SQL.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise