Una empresa recibe diariamente un archivo .xls de ~2 GB en S3 con datos de clientes. Un ingeniero de datos concatena las columnas de nombre y apellido y necesita contar el número de clientes distintos en el archivo. ¿Qué enfoque requiere el menor esfuerzo operativo?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar AWS Glue DataBrew para crear una receta que utilice la función agregada COUNT_DISTINCT para calcular el número de clientes distintos..
Por qué esta es la respuesta
AWS Glue DataBrew es la opción con menor esfuerzo operativo porque es un servicio de preparación de datos visual y sin código que permite a los usuarios limpiar, normalizar y transformar datos sin escribir una sola línea de código. La función COUNTDISTINCT es una operación predefinida que se puede aplicar fácilmente a la columna concatenada, lo que simplifica enormemente el proceso. Las otras opciones requieren más esfuerzo operativo: AWS Glue Studio (Apache Spark en un notebook de AWS Glue) y Amazon EMR Serverless (Apache Spark) implican escribir y mantener código Spark, lo que aumenta la complejidad y el esfuerzo de desarrollo. AWS Glue Data Catalog y Amazon Athena son excelentes para consultar datos, pero primero se necesita un crawler para definir el esquema. Aunque Athena puede ejecutar la consulta COUNT(DISTINCT), la preparación de los datos (concatenación) y la gestión del crawler añaden más pasos manuales o de codificación en comparación con DataBrew.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta