Una empresa de inversión ingiere un volumen cada vez mayor de datos semiestructurados y necesita eliminar los registros duplicados, así como los errores ortográficos comunes. ¿Qué opción proporciona esta capacidad con la menor sobrecarga operativa?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar la característica FindMatches de AWS Glue para eliminar registros duplicados..
Por qué esta es la respuesta
La característica FindMatches de AWS Glue es una herramienta de machine learning (ML) diseñada específicamente para identificar y eliminar registros duplicados y errores ortográficos en conjuntos de datos, incluso cuando no hay identificadores exactos. Esto la hace ideal para datos semiestructurados y volúmenes crecientes, ofreciendo una baja sobrecarga operativa al ser un servicio gestionado. Las funciones no-Windows de Amazon Athena no son una característica estándar para la deduplicación basada en ML y no abordan errores ortográficos de manera eficiente. Amazon Neptune ML y Apache Gremlin se utilizan para grafos y relaciones complejas, no para la deduplicación de registros semiestructurados. Las tablas globales de Amazon DynamoDB replican datos entre regiones y no previenen la inserción de datos duplicados a nivel de contenido, ni corrigen errores ortográficos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta