Necesita fusionar dos conjuntos de datos (pedidos de clientes y descripciones de catálogos de productos) que tienen diferentes estructuras y formatos, haciendo coincidir registros similares y eliminando duplicados. ¿Qué solución es la más adecuada para hacer coincidir y limpiar estos datos?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Ejecutar AWS Glue crawlers para poblar el Glue Data Catalog y usar la transformación Glue FindMatches para identificar registros similares y deduplicar los datos..
Por qué esta es la respuesta
La opción correcta es utilizar AWS Glue crawlers para poblar el Glue Data Catalog y luego la transformación Glue FindMatches. AWS Glue FindMatches es una transformación de machine learning diseñada específicamente para identificar registros duplicados o similares en conjuntos de datos, incluso cuando no hay identificadores únicos perfectos. Esto es ideal para fusionar datos con estructuras y formatos diferentes. Las otras opciones son menos adecuadas: Escribir una función de AWS Lambda para la coincidencia de registros sería ineficiente y complejo de implementar para grandes volúmenes de datos y coincidencias aproximadas. La API Glue SearchTables se utiliza para buscar tablas en el Data Catalog, no para realizar coincidencias aproximadas o deduplicación de datos dentro de las tablas. AWS Lake Formation se centra en la seguridad y el gobierno de los datos en un lago de datos, no ofrece una funcionalidad directa de "transformación de coincidencia" para la deduplicación de registros como FindMatches.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta