Una empresa quiere ejecutar análisis de ML en datos en un data lake de S3. Tienen dos necesidades de transformación: (1) realizar transformaciones diarias programadas en 300 GB de datos de varios formatos que llegan a una hora establecida, y (2) ejecutar una transformación única en terabytes de datos archivados en el lago. Los DAG de Amazon MWAA orquestarán los flujos de trabajo. ¿Qué dos tareas deben programar los DAG para satisfacer estas necesidades de la manera más rentable? (Elija dos).
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Para los datos diarios entrantes, use AWS Glue crawlers para escanear e identificar el esquema., Para los datos diarios y archivados, use Amazon EMR para realizar transformaciones de datos..
Por qué esta es la respuesta
Para los datos diarios entrantes, los AWS Glue crawlers son la opción más rentable y eficiente para escanear y catalogar el esquema de datos en S3. Se integran con el Catálogo de datos de Glue, permitiendo que otros servicios como Athena consulten los datos. Amazon Athena es una herramienta de consulta, no de escaneo de esquema. Amazon Redshift es un almacén de datos, no una herramienta de transformación para un data lake. Para ambas necesidades de transformación (diarias y archivadas), Amazon EMR es una solución robusta y rentable. Permite procesar grandes volúmenes de datos (terabytes) utilizando frameworks de big data como Spark o Hive, lo que es ideal para transformaciones complejas y escalables. Amazon SageMaker está diseñado para el desarrollo y entrenamiento de modelos de ML, no para transformaciones generales de datos a gran escala.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta