Un científico de datos necesita explorar aproximadamente 500 GB de datos históricos de inventario almacenados como archivos CSV en un data lake de Amazon S3. Quiere usar SQL para la exploración y la empresa quiere minimizar los costos y la sobrecarga operativa. ¿Qué enfoque satisface estos requisitos con la menor gestión operativa?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar AWS Glue para rastrear el bucket de S3 y rellenar el AWS Glue Data Catalog, luego consultar los datos con Amazon Athena..
Por qué esta es la respuesta
La opción correcta es usar AWS Glue y Amazon Athena porque proporciona una solución sin servidor y de pago por consulta para explorar datos directamente en Amazon S3. AWS Glue rastrea los datos en S3 para inferir el esquema y poblar el AWS Glue Data Catalog, que Athena utiliza para ejecutar consultas SQL. Esto minimiza la sobrecarga operativa y los costos, ya que no hay infraestructura que aprovisionar o administrar. Aprovisionar un clúster de Amazon EMR (opción A) o Amazon Redshift (opciones C y D) implica la gestión de infraestructura y costos continuos, lo que va en contra del requisito de minimizar la sobrecarga operativa y los costos. Además, ingerir datos en Redshift (opción C) los duplica, aumentando los costos de almacenamiento.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta