Você deve construir um pipeline de ETL que ingere arquivos (CSV, JSON ou Parquet) entregues a cada 15 minutos de 10 sistemas de origem em 10 tabelas do Amazon Redshift. Todos os arquivos chegam em um único bucket S3; os tamanhos dos arquivos variam de 10 MB a 20 GB. O pipeline deve tolerar alterações de esquema. Quais soluções atendem a esses requisitos? (Escolha duas.)
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use uma regra do Amazon EventBridge para invocar um trabalho de fluxo de trabalho do AWS Glue a cada 15 minutos. Configure o fluxo de trabalho do AWS Glue para ter um gatilho sob demanda que executa um crawler do AWS Glue e, em seguida, executa um trabalho do AWS Glue quando o crawler termina de ser executado com sucesso. Configure o trabalho do AWS Glue para processar e carregar os dados nas tabelas do Amazon Redshift., Configure uma função do AWS Lambda para invocar um fluxo de trabalho do AWS Glue quando um arquivo for carregado no bucket S3. Configure o fluxo de trabalho do AWS Glue para ter um gatilho sob demanda que executa um crawler do AWS Glue e, em seguida, executa um trabalho do AWS Glue quando o crawler termina de ser executado com sucesso. Configure o trabalho do AWS Glue para processar e carregar os dados nas tabelas do Amazon Redshift..
Por que esta é a resposta
As opções corretas utilizam um fluxo de trabalho do AWS Glue com um crawler, que é essencial para lidar com a tolerância a alterações de esquema e a variedade de formatos de arquivo (CSV, JSON, Parquet). O crawler atualiza o catálogo de dados, permitindo que o trabalho do Glue processe os dados corretamente. A invocação via EventBridge a cada 15 minutos atende ao requisito de agendamento, enquanto a invocação via Lambda (acionada por S3) permite processamento imediato na chegada do arquivo. Ambas as abordagens garantem a execução do crawler antes do trabalho de ETL. A primeira opção incorreta não inclui um crawler, o que a torna inadequada para lidar com alterações de esquema. A terceira opção incorreta é excessivamente complexa e menos eficiente, pois usa múltiplas funções Lambda e um gatilho sob demanda para o crawler, em vez de integrá-lo diretamente no fluxo de trabalho. A última opção incorreta não usa um crawler para lidar com as alterações de esquema e introduz o Kinesis Data Firehose, que não é a solução mais direta para carregar dados processados pelo Glue no Redshift neste cenário.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão