Uma empresa extrai cerca de 1 TB de dados por dia de fontes como SAP HANA, SQL Server, MongoDB, Kafka e DynamoDB. Algumas fontes têm esquemas indefinidos ou em evolução. A solução deve detectar esquemas, realizar ETL e carregar os dados no S3 em até 15 minutos após a criação dos dados. Qual abordagem oferece a funcionalidade necessária com o menor overhead operacional?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use o AWS Glue para detectar o esquema e para extrair, transformar e carregar os dados no bucket S3. Crie um pipeline no Apache Spark..
Por que esta é a resposta
A opção correta é usar o AWS Glue para detectar o esquema e para extrair, transformar e carregar os dados no S3, criando um pipeline no Apache Spark. O AWS Glue é um serviço ETL sem servidor que gerencia automaticamente a infraestrutura, reduzindo o overhead operacional. Ele inclui um Data Catalog para detecção e gerenciamento de esquemas, suporta diversas fontes de dados mencionadas (SAP HANA, SQL Server, MongoDB, Kafka, DynamoDB) e pode processar grandes volumes de dados (1 TB/dia) com baixa latência (15 minutos) usando Spark. Usar Amazon EMR exigiria gerenciamento de clusters, aumentando o overhead operacional. Um programa PySpark no AWS Lambda é inadequado para 1 TB de dados diários devido aos limites de tempo de execução e memória do Lambda. Criar um procedimento armazenado no Amazon Redshift não é ideal para detecção de esquema de fontes heterogêneas e não é a forma mais eficiente de carregar dados diretamente no S3 para acesso via Redshift Spectrum.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão