Une entreprise partitionne son lac de données Amazon S3 en utilisant des chemins de clés d'objet tels que s3://bucket/prefix/year=2023/month=01/day=01. L'AWS Glue Data Catalog doit rester synchronisé avec S3 lorsque de nouvelles partitions sont ajoutées. Quelle approche offre la latence la plus faible pour maintenir le catalogue à jour ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser du code qui écrit des données dans Amazon S3 pour invoquer l'appel d'API Boto3 AWS Glue create_partition..
Pourquoi c'est la réponse
L'utilisation de code pour invoquer l'appel d'API Boto3 AWS Glue createpartition au moment où les données sont écrites dans S3 offre la latence la plus faible. Cela garantit que le Data Catalog est mis à jour immédiatement après l'ajout de nouvelles partitions, sans délai. Planifier un crawler AWS Glue (même quotidiennement) introduit une latence car il doit parcourir S3 pour découvrir les nouvelles partitions. Exécuter manuellement l'API CreatePartition est sujet à l'erreur humaine et n'est pas automatisé, ce qui augmente la latence. La commande MSCK REPAIR TABLE est utile pour synchroniser des partitions existantes mais n'est pas conçue pour une mise à jour en temps quasi réel et doit être exécutée manuellement ou planifiée, introduisant également de la latence.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise