Una empresa tiene tres subsidiarias que utilizan diferentes motores de almacenamiento (Amazon Redshift, Teradata Vantage en AWS y Google BigQuery). Quieren consolidar los datos en un data lake en S3 usando Apache Iceberg. La nueva pipeline debe conectarse a cada fuente, ejecutar transformaciones usando cada motor de origen, unir los resultados y escribir en Iceberg con un esfuerzo operativo mínimo. ¿Qué enfoque cumple estos requisitos con la menor sobrecarga operativa?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar los conectores de consulta federada de Amazon Athena para Amazon Redshift, Teradata y BigQuery para construir la pipeline en Athena. Escribir una consulta SQL para leer de todas las fuentes de datos, unir los datos y ejecutar una operación Merge en la tabla Iceberg del data lake..
Por qué esta es la respuesta
La opción correcta es usar los conectores de consulta federada de Amazon Athena. Athena permite consultar datos directamente en Amazon Redshift, Teradata (a través de conectores JDBC/ODBC) y Google BigQuery, uniendo los resultados con SQL estándar. Esto minimiza la sobrecarga operativa porque Athena es un servicio sin servidor y la lógica de unión y la operación MERGE en Iceberg se pueden manejar directamente con SQL, sin necesidad de aprovisionar o administrar clústeres. Las otras opciones son menos óptimas: AWS Glue requeriría scripts de ETL más complejos y gestión de jobs. Amazon EMR implicaría la gestión de clústeres, aumentando la sobrecarga. Amazon AppFlow está diseñado para transferencias de SaaS y no es ideal para uniones complejas o la operación MERGE en Iceberg.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta