Una empresa tiene un gran conjunto de datos no estructurados que contiene muchos registros duplicados en atributos clave. ¿Qué solución de AWS identificará los duplicados con la menor cantidad de codificación personalizada?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar la transformación AWS Glue FindMatches para identificar registros duplicados..
Por qué esta es la respuesta
La transformación AWS Glue FindMatches es una solución de machine learning (ML) sin código que identifica registros duplicados o que no coinciden en conjuntos de datos. Permite a los usuarios entrenar un modelo para reconocer registros que se refieren a la misma entidad, incluso si no tienen valores idénticos en todos los atributos. Esto reduce significativamente la necesidad de codificación personalizada. Crear tareas de Amazon Mechanical Turk es un enfoque manual y escalable, pero no es una solución de ML y requiere intervención humana, lo que puede ser costoso y lento para grandes volúmenes. Amazon QuickSight ML Insights se centra en la detección de anomalías y patrones en los datos para visualización, no en la deduplicación de registros. Amazon SageMaker Data Wrangler es una herramienta de preparación de datos que puede ayudar a limpiar y transformar datos, pero la detección de duplicados con ella generalmente requeriría codificación personalizada o la integración con otras herramientas, a diferencia de la funcionalidad específica de FindMatches.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta