Você recebe um arquivo Apache Parquet de 50 MB para um modelo de detecção de fraude que contém várias colunas correlacionadas e desnecessárias. Qual é a maneira com o menor esforço para remover essas colunas do arquivo?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Crie um fluxo de dados no SageMaker Data Wrangler e adicione uma etapa de transformação para descartar as colunas desnecessárias..
Por que esta é a resposta
A opção correta é criar um fluxo de dados no SageMaker Data Wrangler e adicionar uma etapa de transformação para descartar as colunas desnecessárias. O Data Wrangler é uma ferramenta visual de preparação de dados que permite selecionar e remover colunas com baixo esforço, sem a necessidade de escrever código. Ele é ideal para tarefas de limpeza e transformação de dados, especialmente para arquivos de tamanho moderado como 50 MB. As outras opções são menos eficientes: Baixar o arquivo e usar um script Python local é ineficiente e não escalável para grandes volumes de dados ou para automação. Além disso, o one-hot encoding não é o objetivo aqui, mas sim a remoção de colunas. Criar um job Apache Spark no Amazon EMR é uma solução robusta, mas exige mais configuração e gerenciamento de infraestrutura, sendo um esforço maior do que o necessário para uma tarefa simples de remoção de colunas em um arquivo de 50 MB. Iniciar um job de processamento do SageMaker com o SDK Python é uma opção programática que também requer mais esforço de codificação e configuração em comparação com a interface visual do Data Wrangler para esta tarefa específica.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão