Um cientista de dados precisa explorar aproximadamente 500 GB de dados históricos de inventário armazenados como arquivos CSV em um data lake no Amazon S3. Ele quer usar SQL para a exploração e a empresa deseja minimizar custos e sobrecarga operacional. Qual abordagem satisfaz esses requisitos com o mínimo de gerenciamento operacional?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Usar o AWS Glue para rastrear o bucket S3 e popular o AWS Glue Data Catalog, depois consultar os dados com o Amazon Athena..
Por que esta é a resposta
A opção correta, usar AWS Glue e Amazon Athena, minimiza custos e sobrecarga operacional porque Athena é um serviço de consulta sem servidor que paga apenas pelas consultas executadas, sem necessidade de provisionar ou gerenciar infraestrutura. O AWS Glue Data Catalog, populado pelo crawler do Glue, fornece os metadados necessários para o Athena consultar os arquivos CSV diretamente no S3. Provisionar um cluster Amazon EMR ou Amazon Redshift (seja para ingestão ou tabelas externas) incorre em custos contínuos de cluster e exige gerenciamento operacional, o que vai contra os requisitos de minimização de custos e sobrecarga. Embora o Redshift Spectrum (tabelas externas no Redshift) evite a ingestão de dados, o cluster Redshift subjacente ainda precisa ser provisionado e mantido.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão