Los datos de los clientes se almacenan diariamente en S3 en archivos comprimidos y particionados por fecha. Los analistas descargan, validan y suben los resultados a QuickSight mensualmente. El ingeniero debe verificar automáticamente la calidad de los datos antes de enviarlos a QuickSight con la MENOR sobrecarga operativa. ¿Qué solución se ajusta mejor?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecutar un crawler de AWS Glue cada mes para actualizar el AWS Glue Data Catalog. Usar las reglas de AWS Glue Data Quality para verificar la calidad de los datos..
Por qué esta es la respuesta
La opción correcta es ejecutar un crawler de AWS Glue y usar AWS Glue Data Quality. AWS Glue Data Quality (GDQ) está diseñado para evaluar la calidad de los datos directamente en el Data Catalog, lo que minimiza la sobrecarga operativa al integrarse con los metadatos existentes. El crawler de Glue es necesario para mantener el Data Catalog actualizado con las particiones diarias. Las otras opciones son menos eficientes: Un trabajo de AWS Glue con PySpark para funciones personalizadas (opción 2) es más complejo y requiere más desarrollo y mantenimiento. Scripts de Python en Lambda (opción 3) para evaluar la calidad de los datos implican un desarrollo personalizado significativo y no aprovechan las capacidades nativas de calidad de datos de Glue. Además, la invocación por adición de objetos es diaria, no mensual como se requiere. Usar notificaciones de SQS y CloudWatch Insights (opción 4) no es una solución para evaluar la calidad de los datos; SQS gestiona mensajes y CloudWatch monitorea métricas, no el contenido de los datos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta