Un ingeniero de ML debe construir un pipeline que descubra y elimine PII de petabytes de datos no estructurados, y luego use los datos limpios para entrenar modelos de SageMaker. ¿Qué solución cumple con este requisito a escala?
Elige una respuesta
Toca una opción para verificar tu respuesta.
Respuesta correcta: Usar el motor sin servidor basado en Apache Spark en las sesiones interactivas de AWS Glue y aplicar la transformación Detect PII para encontrar y eliminar PII..
Por qué esta es la respuesta
La opción correcta es usar el motor sin servidor basado en Apache Spark en las sesiones interactivas de AWS Glue y aplicar la transformación Detect PII. AWS Glue Interactive Sessions proporciona un entorno Apache Spark gestionado y escalable, ideal para procesar petabytes de datos no estructurados. La transformación "Detect PII" de AWS Glue DataBrew (que se puede integrar con Glue) o una implementación personalizada en Spark permite identificar y eliminar PII de manera eficiente. Las otras opciones son menos adecuadas: AWS Glue Data Wrangler dentro de Amazon SageMaker Canvas está diseñado para la preparación de datos interactiva en conjuntos de datos más pequeños y no escala eficientemente para petabytes. Amazon SageMaker Clarify se utiliza principalmente para la detección de sesgos y la explicabilidad del modelo, no para la detección y eliminación de PII a gran escala. La API DetectEntities de Amazon Comprehend es para el procesamiento de lenguaje natural y la extracción de entidades, pero no está optimizada para el procesamiento masivo de petabytes de datos no estructurados con el propósito de eliminar PII de forma programática en un pipeline de datos.
Aprueba tu examen — sin la interminable búsqueda de respuestas
Obtén todas las preguntas y explicaciones verificadas para este examen en un solo lugar, y ahorra horas de preparación. Más de 1,000 certificaciones · Más de 20 idiomas · Empieza gratis.
Aprueba tu examen más rápido → No se requiere tarjeta