Una empresa particiona su data lake de Amazon S3 utilizando rutas de claves de objeto como s3://bucket/prefix/year=2023/month=01/day=01. El AWS Glue Data Catalog debe permanecer sincronizado con S3 cuando se añaden nuevas particiones. ¿Qué enfoque proporciona la latencia más baja para mantener el catálogo actualizado?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar código que escribe datos en Amazon S3 para invocar la llamada a la API Boto3 AWS Glue create_partition..
Por qué esta es la respuesta
La opción correcta es usar código que escribe datos en Amazon S3 para invocar la llamada a la API Boto3 AWS Glue createpartition. Este método ofrece la latencia más baja porque actualiza el Catálogo de datos de AWS Glue inmediatamente después de que se crean nuevas particiones en S3. Esto asegura que los datos recién agregados sean descubribles y consultables casi en tiempo real. Programar un rastreador de AWS Glue introduce latencia porque solo se ejecuta en intervalos predefinidos, lo que significa que las nuevas particiones no serán visibles hasta la próxima ejecución del rastreador. Ejecutar manualmente la API AWS Glue CreatePartition dos veces al día es un proceso manual y también introduce latencia significativa. Ejecutar el comando MSCK REPAIR TABLE desde la consola de AWS Glue es una operación que puede llevar tiempo en conjuntos de datos grandes y no es un proceso continuo o de baja latencia.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta