Una empresa está migrando una aplicación heredada a un data lake basado en S3. Los datos heredados contienen registros duplicados. El ingeniero de datos debe identificar y eliminar los duplicados con la MENOR sobrecarga operativa. ¿Qué solución debe elegir el ingeniero?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Escribir un trabajo de extracción, transformación y carga (ETL) de AWS Glue. Usar la transformación de machine learning (ML) FindMatches para transformar los datos y realizar la deduplicación de datos..
Por qué esta es la respuesta
La opción correcta es usar un trabajo de AWS Glue ETL con la transformación FindMatches. AWS Glue es un servicio ETL sin servidor que minimiza la sobrecarga operativa. FindMatches es una transformación de machine learning de Glue que identifica registros duplicados incluso si no son idénticos (coincidencia difusa), lo cual es crucial para datos heredados que a menudo tienen inconsistencias. Las otras opciones son menos óptimas: Escribir un trabajo ETL personalizado en Python con Pandas o la biblioteca dedupe requiere gestionar la infraestructura subyacente y escalar la solución, lo que aumenta la sobrecarga operativa. Pandas.dropduplicates() solo funciona para duplicados exactos. Importar la biblioteca dedupe de Python en un trabajo de AWS Glue ETL es posible, pero FindMatches está optimizado y es nativo de Glue, ofreciendo una integración más sencilla y una menor sobrecarga de configuración y mantenimiento para la deduplicación basada en ML.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta