Você precisa realizar uma análise exploratória de dados (EDA) em um conjunto de dados de escala de petabytes, sem gerenciar a infraestrutura do cluster, pagando apenas pelas consultas que executa e escrevendo a análise em Python a partir de um notebook Jupyter. Qual solução satisfaz essas restrições?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Executar Apache Spark de dentro do Amazon Athena..
Por que esta é a resposta
A opção correta é executar Apache Spark de dentro do Amazon Athena. O Amazon Athena é um serviço de consulta interativa sem servidor que permite analisar dados diretamente no Amazon S3 usando SQL padrão. Recentemente, o Athena adicionou suporte para Apache Spark, permitindo a execução de cargas de trabalho Spark sem provisionar ou gerenciar clusters. Isso atende à necessidade de não gerenciar infraestrutura e pagar apenas pelas consultas. A integração com notebooks Jupyter via Amazon SageMaker Studio é nativa, facilitando a análise em Python. Executar Apache Spark de dentro do Amazon SageMaker não é a solução mais direta para dados em petabytes no S3 sem gerenciar infraestrutura, pois o SageMaker é mais focado em treinamento e inferência de modelos, e o Spark no SageMaker geralmente envolve clusters gerenciados ou instâncias específicas. Executar Apache Spark em um cluster Amazon EMR que você provisiona viola a restrição de não gerenciar a infraestrutura. Usar Apache Spark integrado ao Amazon Redshift não é ideal, pois o Redshift é um data warehouse relacional e não a melhor escolha para análise exploratória direta em petabytes de dados no S3 sem gerenciamento de infraestrutura, além de não ser a forma nativa de executar Spark no Redshift.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão