Un ingénieur ML utilisera Amazon SageMaker Canvas pour entraîner un modèle avec des données à structure complexe stockées dans Amazon S3. Quel format de fichier minimisera le temps de prétraitement de ces données ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Fichiers Apache Parquet.
Pourquoi c'est la réponse
Les fichiers Apache Parquet sont un format de stockage de données en colonnes optimisé pour l'analyse de grands ensembles de données. Leur structure en colonnes permet une lecture plus rapide des données pertinentes, car seules les colonnes nécessaires sont chargées, ce qui réduit considérablement les E/S et le temps de prétraitement, surtout avec des données complexes. De plus, Parquet intègre des schémas et des statistiques de données, facilitant l'optimisation des requêtes. Les fichiers CSV compressés avec Snappy, bien que performants pour la compression, restent un format ligne par ligne, ce qui est moins efficace pour l'accès sélectif aux colonnes. Les objets JSON au format JSONL et les fichiers JSON compressés avec gzip sont également des formats ligne par ligne. Bien que JSONL soit plus facile à parser que des fichiers JSON monolithiques, et que gzip offre une bonne compression, ces formats ne bénéficient pas des optimisations de lecture en colonnes de Parquet, ce qui les rend moins efficaces pour le prétraitement de données complexes dans SageMaker Canvas.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise