Um engenheiro de dados precisa, pontualmente, ler objetos Apache Parquet em um bucket S3 e extrair apenas uma única coluna. Qual opção alcança isso com o mínimo de sobrecarga operacional?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Usar o S3 Select para escrever uma instrução SQL SELECT para recuperar a coluna necessária dos objetos S3..
Por que esta é a resposta
A opção S3 Select é a mais eficiente para este caso de uso. Ela permite executar consultas SQL diretamente nos dados armazenados no S3, incluindo arquivos Parquet, sem a necessidade de carregar o objeto inteiro. Isso minimiza a sobrecarga operacional e os custos, pois apenas os dados relevantes (a coluna desejada) são processados e transferidos. As outras opções envolvem mais passos e recursos: AWS Lambda com pandas: Exige carregar o objeto completo para a memória da função Lambda, o que pode ser ineficiente e caro para objetos grandes. AWS Glue DataBrew: É uma ferramenta de preparação de dados mais robusta, mas excessiva para uma simples extração de coluna, introduzindo maior complexidade e custo. AWS Glue Crawler e Amazon Athena: Embora eficaz para consultar dados em S3, exige a criação e manutenção de um catálogo de dados (Glue Data Catalog) e a execução do crawler, o que é uma sobrecarga maior para uma necessidade pontual de extrair uma única coluna.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão