Você tem arquivos CSV no Amazon S3 que incluem uma coluna de timestamp formatada como: 1º de março de 2020, 08:14pm. Você levanta a hipótese de que o dia da semana, o mês e a hora afetam a variável de destino, então você precisa adicionar três novas features (dia da semana, mês, hora) ao conjunto de dados. Qual abordagem adiciona essas features exigindo o menor overhead operacional para produzir um novo arquivo no S3?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Criar um novo fluxo no Amazon SageMaker Data Wrangler: importar o arquivo S3, aplicar a transformação Featurize date/time para gerar as colunas de dia da semana, mês e hora e, em seguida, exportar o conjunto de dados para o S3..
Por que esta é a resposta
A abordagem com o SageMaker Data Wrangler é a mais eficiente operacionalmente. Ele oferece uma interface visual e transformações pré-construídas, como "Featurize date/time", que automatizam a extração de dia da semana, mês e hora de uma coluna de timestamp. Isso minimiza a necessidade de escrever código e gerenciar infraestrutura, reduzindo o overhead. Provisionar um cluster Amazon EMR ou criar um job AWS Glue envolve a escrita e manutenção de código (PySpark ou Python) e o gerenciamento de recursos computacionais, aumentando o overhead operacional. Um job de processamento do Amazon SageMaker também requer a escrita de código Python, embora o gerenciamento de recursos seja simplificado em comparação com o EMR ou Glue.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão