Une entreprise dispose d'un dossier S3 qui contient des types de fichiers mixtes (CSV, JSON, XLSX et Apache Parquet). Un ingénieur ML utilisera AWS Glue DataBrew pour traiter les données et doit enregistrer le résultat final dans S3 afin qu'AWS Glue puisse le consommer ultérieurement. Quelle approche satisfait ces exigences ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Séparez les fichiers en dossiers distincts par type de fichier, traitez chaque dossier avec DataBrew et écrivez les sorties au format Apache Parquet..
Pourquoi c'est la réponse
La bonne approche consiste à séparer les fichiers par type avant de les traiter avec DataBrew. Bien que DataBrew puisse ingérer des données de différents formats, il est plus efficace et plus fiable de traiter des ensembles de données homogènes. En séparant les fichiers par type (CSV, JSON, XLSX, Parquet) dans des dossiers distincts, vous pouvez créer des recettes DataBrew spécifiques et optimisées pour chaque format, ce qui améliore la précision du traitement et réduit les erreurs potentielles. Le format Apache Parquet est un excellent choix pour la sortie car il est un format de colonne optimisé pour l'analyse, compatible avec AWS Glue et d'autres services d'analyse. Le format "AWS Glue Parquet" n'existe pas en tant que format distinct ; AWS Glue utilise le format Apache Parquet standard. Les autres options ne sont pas optimales car le traitement de types de fichiers mixtes dans un seul job DataBrew peut entraîner des problèmes de schéma ou de performance.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise