Pour accélérer les requêtes Amazon Athena, un ingénieur de données constate que tous les fichiers d'entrée sont des .csv non compressés et que la plupart des requêtes sélectionnent une seule colonne. Quel changement améliorera le PLUS les performances des requêtes Athena ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Changer le format de données de .csv à Apache Parquet. Appliquer la compression Snappy..
Pourquoi c'est la réponse
Le changement vers Apache Parquet avec compression Snappy est le plus efficace. Parquet est un format de stockage de données en colonnes, optimisé pour les requêtes analytiques. Il permet à Athena de lire uniquement les colonnes nécessaires, réduisant considérablement la quantité de données scannées, ce qui est idéal puisque la plupart des requêtes sélectionnent une seule colonne. La compression Snappy réduit la taille des fichiers, améliorant les performances et réduisant les coûts. Convertir en JSON n'est pas optimal car JSON est un format ligne par ligne, moins efficace que Parquet pour les requêtes colonnaires. Compresser les CSV existants avec Snappy ou Gzip améliorerait la taille des fichiers, mais ne résoudrait pas le problème de la lecture de toutes les colonnes, inhérent au format CSV.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise