Una empresa extrae aproximadamente 1 TB de datos al día de fuentes como SAP HANA, SQL Server, MongoDB, Kafka y DynamoDB. Algunas fuentes tienen esquemas indefinidos o en evolución. La solución debe detectar esquemas, realizar ETL y cargar los datos en S3 en un plazo de 15 minutos desde la creación de los datos. ¿Qué enfoque proporciona la funcionalidad requerida con la menor sobrecarga operativa?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Utilizar AWS Glue para detectar el esquema y para extraer, transformar y cargar los datos en el bucket de S3. Crear un pipeline en Apache Spark..
Por qué esta es la respuesta
AWS Glue es la opción más adecuada porque es un servicio de ETL sin servidor que incluye un rastreador (Crawler) para descubrir esquemas de datos de diversas fuentes, incluyendo aquellas con esquemas indefinidos o en evolución. Esto reduce significativamente la sobrecarga operativa. Además, AWS Glue permite ejecutar trabajos de ETL utilizando Apache Spark, lo que es eficiente para procesar grandes volúmenes de datos (1 TB diario) y cumplir con el requisito de 15 minutos. Amazon EMR requeriría la gestión de clústeres, aumentando la sobrecarga operativa. AWS Lambda no es ideal para procesar 1 TB de datos diarios debido a sus límites de tiempo de ejecución y memoria. Amazon Redshift es un data warehouse, no una herramienta de ETL principal para este escenario, y Redshift Spectrum se usa para consultar datos en S3, no para la ingesta y transformación inicial de datos de múltiples fuentes.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta