Un job ETL doit traiter quotidiennement des fichiers .csv que les utilisateurs placent dans un bucket S3. Chaque fichier est plus petit que 100 Mo. Quelle implémentation est la plus rentable ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Écrire un job AWS Glue Python shell. Utiliser pandas pour transformer les données..
Pourquoi c'est la réponse
La solution la plus rentable pour traiter des fichiers CSV de moins de 100 Mo est un job AWS Glue Python shell utilisant pandas. Les jobs Python shell sont conçus pour des charges de travail légères et sont facturés à la seconde, ce qui est très économique pour de petits volumes de données. Pandas est une bibliothèque Python efficace pour la manipulation de données. Les autres options sont moins rentables pour cette taille de données : Une application Python personnalisée sur Amazon EKS est une solution sur-provisionnée et plus complexe à gérer pour cette tâche simple. Un script PySpark sur Amazon EMR ou un job AWS Glue PySpark sont des solutions puissantes pour le traitement de Big Data (plusieurs gigaoctets à téraoctets), mais ils entraînent des coûts plus élevés en raison de l'allocation de ressources Spark, qui est excessive pour des fichiers de moins de 100 Mo.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise