Tiene datos de sensores de suelo de IoT en una tabla de Amazon DynamoDB de 10 GB y datos de eventos meteorológicos como archivos JSON de 5 GB en Amazon S3. Desea preparar este conjunto de datos combinado para entrenar un modelo de Amazon SageMaker con la menor sobrecarga administrativa. ¿Qué enfoque logra mejor la transformación requerida?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecutar AWS Glue crawlers para catalogar los datos. Crear un trabajo ETL de AWS Glue que fusione los conjuntos de datos de DynamoDB y S3 y escriba la salida fusionada como archivos CSV en Amazon S3..
Por qué esta es la respuesta
La opción correcta aprovecha AWS Glue para catalogar automáticamente los esquemas de los datos en DynamoDB y S3, lo que reduce la sobrecarga administrativa. Un trabajo ETL de AWS Glue puede luego fusionar estos conjuntos de datos y exportar el resultado a S3 en formato CSV, que es ideal para el entrenamiento de modelos de SageMaker. Iniciar un clúster de Amazon EMR es una solución viable pero implica más sobrecarga administrativa en comparación con AWS Glue, que es un servicio sin servidor. La opción de Redshift es innecesaria porque SageMaker puede leer directamente desde S3, y Redshift introduce costos y complejidad adicionales. La opción de DynamoDB Streams y Lambda es ineficiente para fusionar grandes volúmenes de datos históricos y está diseñada para procesar cambios en tiempo real, no para una transformación masiva inicial.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta