AdView Inc. souhaite créer un flux SageMaker Data Wrangler unique qui joint un fichier CSV S3 de journaux de campagne à une table Redshift de profils clients, puis exporte l'ensemble de données nettoyé et joint au format Parquet. Le cluster Redshift se trouve dans un sous-réseau privé. Quelle est la séquence d'actions correcte pour implémenter cela dans Data Wrangler tout en garantissant la connectivité et l'exactitude ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Téléchargez le fichier CSV S3 en tant qu'ensemble de données Data Wrangler et ajoutez Redshift en tant qu'autre ensemble de données dans le flux en utilisant les informations d'identification JDBC de Redshift. Ajoutez une transformation Join dans le flux en spécifiant les clés de jointure. Configurez le traitement/l'exportation du flux Data Wrangler pour qu'il s'exécute dans un VPC avec des sous-réseaux et des groupes de sécurité qui autorisent l'accès au cluster Redshift, et assurez-vous que le rôle IAM utilisé par Data Wrangler a l'autorisation d'accéder à S3 et aux informations d'identification Redshift..
Pourquoi c'est la réponse
L'option correcte décrit la procédure standard pour connecter Data Wrangler à des sources de données dans un VPC privé, comme Redshift. Il est essentiel de configurer Data Wrangler pour qu'il s'exécute dans le même VPC que Redshift, avec les sous-réseaux et groupes de sécurité appropriés, afin d'établir la connectivité réseau. Les informations d'identification JDBC sont nécessaires pour l'authentification auprès de Redshift, et un rôle IAM avec les autorisations S3 et Redshift est indispensable. Les autres options sont incorrectes car : Data Wrangler ne crée pas automatiquement de proxy de base de données Redshift et nécessite une configuration VPC explicite pour accéder aux ressources privées. Exporter les deux ensembles de données vers S3 et utiliser Glue ETL est une solution possible, mais elle contourne l'utilisation de Data Wrangler pour la jointure, ce qui n'est pas l'objectif de la question. De plus, Data Wrangler peut accéder à Redshift. Créer un crawler Glue et effectuer une jointure fédérée dans Redshift ne permet pas à Data Wrangler de gérer la jointure directement et ne résout pas le problème de connectivité réseau pour Data Wrangler lui-même.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise