StreamVid gère des téraoctets de journaux CSV bruts dans S3 et a besoin d'un profilage automatisé et d'une transformation reproductible (analyser les horodatages, supprimer les colonnes à faible cardinalité, convertir en Parquet) avant l'entraînement. Quel workflow DataBrew répond le mieux à ces exigences et que doit-on garantir pour les exécutions planifiées ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Créez un jeu de données DataBrew pointant vers le chemin S3, exécutez un travail de profilage pour générer des statistiques, rédigez une recette avec les étapes requises (analyser les horodatages, supprimer les colonnes, convertir en Parquet), puis créez un travail DataBrew qui écrit la sortie Parquet dans S3. Planifiez le travail DataBrew et assurez-vous que le rôle du travail dispose des autorisations de lecture/écriture S3 et que le chemin du jeu de données est accessible depuis le VPC du travail (si vous en spécifiez un)..
Pourquoi c'est la réponse
Cette option décrit le processus standard et recommandé pour utiliser AWS Glue DataBrew afin de répondre aux exigences de StreamVid. DataBrew est conçu pour le profilage de données, la transformation reproductible via des recettes et la conversion de formats, y compris Parquet. Les jobs DataBrew peuvent être planifiés pour des exécutions récurrentes. Il est crucial d'assurer que le rôle IAM du job dispose des autorisations S3 nécessaires et que l'accès au VPC est correctement configuré si le job opère dans un VPC spécifique. Les autres options sont incorrectes car : Lancer un travail AWS Glue ETL : Bien que Glue puisse effectuer ces tâches, DataBrew est spécifiquement conçu pour le profilage et la transformation sans code, et il supporte la planification et l'écriture en Parquet. Utiliser les informations d'identification de l'utilisateur IAM stockées dans le travail est une mauvaise pratique de sécurité. Utiliser SageMaker Data Wrangler : Data Wrangler est une option viable pour la préparation de données, mais l'affirmation selon laquelle DataBrew ne peut pas produire de sorties Parquet ou d'exécutions planifiées est fausse. Créer une fonction Lambda : Une fonction Lambda serait trop complexe et coûteuse à maintenir pour des téraoctets de données, et elle ne fournit pas les capacités de profilage et de transformation reproductible de DataBrew.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise