Un ingénieur de données a un besoin ponctuel de lire des objets Apache Parquet dans un compartiment S3 et d'extraire une seule colonne. Quelle option permet d'y parvenir avec un minimum de frais opérationnels ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser S3 Select pour écrire une instruction SQL SELECT afin de récupérer la colonne requise des objets S3..
Pourquoi c'est la réponse
L'option correcte est d'utiliser S3 Select. S3 Select permet d'exécuter des requêtes SQL directement sur des objets stockés dans S3, y compris les fichiers Parquet, pour extraire uniquement les données nécessaires. Cela réduit considérablement les frais opérationnels car il n'est pas nécessaire de provisionner ou de gérer des serveurs, ni de charger l'intégralité de l'objet en mémoire. Les autres options sont moins optimales pour un besoin ponctuel et minimaliste : Une fonction AWS Lambda avec Pandas nécessiterait de charger l'objet entier dans la mémoire de la fonction, ce qui peut être coûteux en temps et en ressources pour de grands fichiers, et demande plus de gestion. AWS Glue DataBrew est un service de préparation de données visuel, plus adapté à des transformations complexes et répétitives, pas à une simple extraction de colonne ponctuelle. L'exécution d'un crawler AWS Glue suivie d'une requête Athena est une solution robuste pour des requêtes ad-hoc sur des jeux de données plus importants et structurés, mais elle introduit des frais opérationnels supplémentaires (gestion du crawler, du catalogue de données) qui sont excessifs pour un besoin ponctuel d'extraction d'une seule colonne.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise