Uma empresa armazena dados de clickstream de série temporal diários no Amazon S3 (milhões de linhas por dia). Engenheiros de ML executam relatórios diários e analisam tendências de três dias com o Amazon Athena. Os dados devem ser retidos por 30 dias antes do arquivamento. Qual design oferece o maior desempenho de recuperação de dados?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Particionar os objetos de série temporal no S3 por prefixo de data e aplicar políticas de ciclo de vida do S3 para arquivar partições com mais de 30 dias para o S3 Glacier Flexible Retrieval..
Por que esta é a resposta
A opção correta é particionar os objetos de série temporal no S3 por prefixo de data e aplicar políticas de ciclo de vida do S3. Particionar os dados por data (ex: s3://bucket/ano=YYYY/mes=MM/dia=DD/) permite que o Amazon Athena filtre e leia apenas os dados relevantes para a consulta, reduzindo significativamente a quantidade de dados escaneados e melhorando o desempenho. As políticas de ciclo de vida do S3 automatizam o arquivamento de dados com mais de 30 dias para o S3 Glacier Flexible Retrieval, otimizando custos e gerenciamento. Manter todos os dados em um único bucket sem partições (opção 1) força o Athena a escanear todos os dados, resultando em desempenho ruim e custos elevados. Usar o AWS Lambda para copiar arquivos (opção 2) adiciona complexidade e custo desnecessários, pois as políticas de ciclo de vida do S3 já realizam essa função de forma nativa. Armazenar cada dia em seu próprio bucket S3 (opção 4) é uma má prática, pois o número de buckets é limitado e dificulta o gerenciamento e a consulta de dados.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão