Uma empresa executa um pipeline diário de ETL implementado como scripts Python em uma grande instância EC2 para limpar, transformar, enriquecer e compactar terabytes de dados de interação do usuário armazenados no S3. O processo leva mais de 20 horas e eles querem sair do EC2 para uma solução gerenciada e serverless com o mínimo esforço de desenvolvimento. Qual abordagem atende a esses requisitos?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Criar um job do AWS Glue, converter os scripts para PySpark, executar o job do Glue para processar os dados e armazenar os resultados no S3..
Por que esta é a resposta
A opção correta é criar um job do AWS Glue, converter os scripts para PySpark, executar o job do Glue para processar os dados e armazenar os resultados no S3. O AWS Glue é um serviço ETL sem servidor e totalmente gerenciado, ideal para processar grandes volumes de dados (terabytes) com PySpark, que é compatível com Python. Isso minimiza o esforço de desenvolvimento, pois os scripts Python existentes podem ser adaptados para PySpark. As outras opções são menos adequadas: Carregar dados no Amazon Redshift e usar SQL não atende ao requisito de usar scripts Python existentes e pode ser mais complexo para ETL de terabytes. Usar Amazon DynamoDB e AWS Lambda para terabytes de dados pode ser ineficiente e caro, pois o Lambda tem limites de tempo de execução e memória, e o DynamoDB não é otimizado para grandes transformações de dados em lote. Implementar cada script como funções Lambda separadas e orquestrá-las com Step Functions (Data Science SDK) ainda enfrenta as limitações do Lambda para processamento de terabytes e longas durações, além de exigir mais refatoração do código.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão