Um trabalho de ETL deve processar arquivos .csv diários que os usuários colocam em um bucket S3. Cada arquivo tem menos de 100 MB. Qual implementação é a mais econômica?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Escrever um trabalho AWS Glue Python shell. Usar pandas para transformar os dados..
Por que esta é a resposta
A opção mais econômica para processar arquivos CSV diários menores que 100 MB é usar um trabalho AWS Glue Python shell com a biblioteca pandas. O AWS Glue Python shell é ideal para cargas de trabalho leves e de curta duração, pois não provisiona um cluster Spark completo, resultando em custos significativamente menores. Pandas é eficiente para manipulação de dados em memória para arquivos desse tamanho. As outras opções são menos econômicas para este caso de uso. Um aplicativo Python personalizado em Amazon EKS ou um script PySpark em Amazon EMR envolvem o gerenciamento e o custo de clusters de computação, que são superdimensionados para arquivos tão pequenos. Um trabalho AWS Glue PySpark, embora gerenciado, ainda provisiona recursos Spark que são mais caros e desnecessários para arquivos abaixo de 100 MB, onde o processamento em memória com pandas é suficiente.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão