Une entreprise dispose de 10 à 15 To de fichiers .csv non compressés dans Amazon S3 et prévoit d'effectuer une évaluation unique à l'aide d'Amazon Athena. L'entreprise souhaite transformer les données pour réduire les temps de requête et les coûts de stockage. Quel format de fichier et quel choix de compression répondent le mieux à ces exigences pour les requêtes Athena ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Format Apache Parquet compressé avec Snappy.
Pourquoi c'est la réponse
Le format Apache Parquet compressé avec Snappy est le meilleur choix car Parquet est un format de stockage de données en colonnes, optimisé pour les requêtes analytiques comme celles effectuées par Athena. Sa nature colonnaire permet à Athena de lire uniquement les colonnes nécessaires, réduisant ainsi la quantité de données scannées et, par conséquent, les coûts et les temps de requête. Snappy est un codec de compression rapide, offrant un bon équilibre entre taux de compression et vitesse de décompression, ce qui est crucial pour les performances d'Athena. Les fichiers .csv (même compressés) sont des formats ligne par ligne, ce qui signifie qu'Athena doit lire toutes les données d'une ligne, même si une seule colonne est requise, augmentant les coûts et le temps. JSON est également un format ligne par ligne et n'est pas optimisé pour les requêtes analytiques. Avro est un format ligne par ligne binaire, mais Parquet est généralement plus performant pour les requêtes analytiques en raison de son stockage en colonnes. LZO est une bonne option de compression, mais Snappy est souvent préféré pour sa rapidité avec Parquet.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise