Una empresa almacena datos transaccionales semiestructurados en S3. Algunos archivos son muy pequeños, mientras que otros tienen decenas de terabytes. La fuente envía una instantánea JSON completa una vez al día y también envía registros modificados al data lake. Un ingeniero de datos debe realizar la captura de datos modificados (CDC) para identificar los cambios de la manera más rentable. ¿Cuál es la solución MÁS rentable?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar un formato de data lake de código abierto para fusionar la fuente de datos con el data lake de S3 para insertar los datos nuevos y actualizar los datos existentes..
Por qué esta es la respuesta
La opción más rentable es utilizar un formato de data lake de código abierto como Apache Iceberg, Apache Hudi o Delta Lake. Estos formatos están diseñados para gestionar datos en S3 y permiten operaciones ACID (Atomicidad, Consistencia, Aislamiento, Durabilidad), incluyendo la fusión de datos (merge) para insertar nuevos registros y actualizar los existentes de manera eficiente. Esto es crucial para CDC y evita reprocesar conjuntos de datos completos. Las otras opciones son menos rentables o adecuadas: Una función Lambda para identificar cambios sería ineficiente y costosa para archivos grandes o un volumen significativo de datos, ya que tendría que leer y comparar grandes cantidades de datos. Ingerir datos en Amazon RDS o Aurora MySQL y luego usar AWS DMS introduce un paso intermedio de base de datos relacional, lo que añade complejidad, latencia y costos de infraestructura y licencias innecesarios para datos semiestructurados en un data lake.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta