Um engenheiro de dados configurou um crawler do AWS Glue para catalogar dados em um bucket S3 que contém arquivos .csv e .json. O crawler foi configurado para excluir os arquivos .json, mas ao executar consultas no Athena, os arquivos .json ainda estão sendo processados. O engenheiro deve corrigir isso sem alterar o acesso aos arquivos .csv e deseja os menores tempos de consulta possíveis. Qual é a melhor solução?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Mover os arquivos .json para um caminho diferente dentro do bucket S3..
Por que esta é a resposta
Mover os arquivos .json para um caminho diferente dentro do bucket S3 é a melhor solução porque o AWS Glue Crawler já foi configurado para excluir esses arquivos. Ao movê-los, o crawler não os encontrará, e o catálogo do Glue (e, consequentemente, o Athena) não os incluirá nas tabelas. Isso garante que as consultas do Athena não processem os arquivos .json, otimizando o tempo de consulta e evitando custos desnecessários, sem afetar o acesso aos arquivos .csv. Ajustar as configurações do crawler novamente não resolveria, pois a questão afirma que ele já está configurado para excluir os .json. Usar o console do Athena para excluir arquivos .json em cada consulta seria ineficiente e propenso a erros. Usar políticas de bucket S3 para bloquear o acesso aos arquivos .json impediria o acesso, mas o Athena ainda tentaria processar os metadados catalogados, podendo gerar erros ou não resolver completamente o problema de desempenho.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão