Vous devez interroger un jeu de données dans Amazon S3 à l'aide d'Amazon Athena. Le jeu de données contient plus de 800 000 enregistrements CSV ; chaque enregistrement a 200 colonnes et pèse environ 1,5 Mo, mais la plupart des requêtes n'accèdent qu'à 5 à 10 colonnes. Quelle conversion de format minimisera le temps d'exécution des requêtes ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Convertir le jeu de données au format de colonne Apache Parquet..
Pourquoi c'est la réponse
La conversion au format Apache Parquet est la meilleure option car Parquet est un format de stockage de données en colonnes. Cela signifie que seules les colonnes nécessaires à une requête sont lues, ce qui réduit considérablement la quantité de données scannées et, par conséquent, le temps d'exécution des requêtes, surtout lorsque seulement 5 à 10 colonnes sur 200 sont interrogées. Les formats JSON et XML sont des formats de données semi-structurés basés sur des lignes, ce qui entraînerait la lecture de toutes les données de chaque ligne, même si la plupart des colonnes ne sont pas pertinentes pour la requête. La compression GZIP des fichiers CSV réduirait la taille de stockage et le temps de transfert, mais n'optimiserait pas la lecture des colonnes individuelles, car le fichier compressé devrait toujours être décompressé et analysé ligne par ligne.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise