Un ingénieur de données doit charger des fichiers .csv structurés (15 colonnes) dans un lac de données Amazon S3. Les analystes exécutent des requêtes Amazon Athena qui ne référencent généralement qu'une ou deux colonnes et scannent rarement le fichier entier. Quelle approche est la plus rentable ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créer un job AWS Glue d'extraction, transformation et chargement (ETL) pour lire à partir de la source de données structurées .csv. Configurer le job pour écrire les données dans le lac de données au format Apache Parquet..
Pourquoi c'est la réponse
L'approche la plus rentable consiste à utiliser un job AWS Glue ETL pour convertir les fichiers .csv en Apache Parquet. Parquet est un format de stockage de données en colonnes, ce qui signifie qu'il stocke les données colonne par colonne. Cela est très efficace pour les requêtes Athena qui ne référencent qu'une ou deux colonnes, car Athena n'a pas besoin de scanner l'intégralité du fichier pour récupérer les données pertinentes, réduisant ainsi les coûts de numérisation. Les formats .csv et JSON sont des formats orientés ligne, ce qui rend les requêtes partielles moins efficaces et plus coûteuses. Apache Avro est un format orienté ligne qui n'offre pas les mêmes avantages de performance pour les requêtes sélectives que Parquet.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise