Um engenheiro de ML deve construir um pipeline que descubra e remova PII de petabytes de dados não estruturados e, em seguida, use os dados limpos para treinar modelos do SageMaker. Qual solução atende a esse requisito em escala?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use o mecanismo serverless baseado em Apache Spark nas sessões interativas do AWS Glue e aplique a transformação Detect PII para encontrar e remover PII..
Por que esta é a resposta
A opção correta é usar o mecanismo serverless baseado em Apache Spark nas sessões interativas do AWS Glue e aplicar a transformação Detect PII para encontrar e remover PII. O AWS Glue é um serviço de ETL (Extract, Transform, Load) serverless que pode processar petabytes de dados não estruturados de forma escalável. A transformação "Detect PII" (Detectar PII) é uma funcionalidade nativa do AWS Glue que identifica e remove informações de identificação pessoal, sendo ideal para este cenário. As sessões interativas do Glue permitem desenvolver e testar o código Spark de forma iterativa. As outras opções são menos adequadas: AWS Glue Data Wrangler no Amazon SageMaker Canvas é para preparação de dados em escala menor e mais interativa, não otimizado para petabytes de dados não estruturados. Amazon SageMaker Clarify é usado para detecção de viés e explicabilidade de modelos, não para detecção e remoção de PII em dados brutos. A API DetectEntities do Amazon Comprehend é para reconhecimento de entidades em texto e não oferece uma solução completa e escalável para remoção de PII em petabytes de dados não estruturados, como o AWS Glue.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão