Una empresa recopila datos de muchas fuentes en un bucket de S3, ejecuta un trabajo ETL de AWS Glue para transformarlos y almacena la salida transformada en un data lake basado en S3 consultado por Amazon Athena. La empresa necesita identificar registros coincidentes incluso cuando no hay un identificador único compartido. ¿Qué solución logrará esto?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Entrenar y usar la transformación AWS Lake Formation FindMatches en el trabajo ETL..
Por qué esta es la respuesta
La transformación AWS Lake Formation FindMatches es la solución correcta porque está diseñada específicamente para identificar registros coincidentes en conjuntos de datos, incluso cuando no existe un identificador único compartido. Utiliza técnicas de aprendizaje automático para reconocer patrones y similitudes entre registros. Las otras opciones son incorrectas: Amazon Macie se enfoca en el descubrimiento y protección de datos sensibles, no en la identificación de registros coincidentes para la deduplicación o vinculación. La clase AWS Glue PySpark Filter se usa para filtrar registros basados en condiciones específicas, no para encontrar coincidencias difusas sin un identificador único. Particionar tablas y usar un identificador único no resuelve el problema de encontrar registros coincidentes cuando no hay un identificador único compartido, que es el requisito clave del problema.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta