Uma empresa de varejo carrega arquivos CSV de pedidos de varejo diários em um único caminho do S3 e usa o Amazon Redshift Spectrum para consultar subconjuntos dos dados com mais de 100 colunas. A fonte de terceiros produz mais de 30 arquivos CSV por dia (50–70 MB cada). Os usuários agregam métricas diárias, mas o desempenho da consulta se degradou. Qual combinação de ações resolverá os problemas de desempenho com o menor esforço de desenvolvimento? (Escolha duas.)
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Configure o aplicativo de terceiros para produzir os arquivos em um formato colunar., Particione os dados do pedido no bucket S3 por data do pedido..
Por que esta é a resposta
A configuração dos arquivos em formato colunar (como Parquet ou ORC) é crucial porque o Redshift Spectrum se beneficia enormemente de formatos que permitem a leitura seletiva de colunas. Com mais de 100 colunas, ler apenas as colunas necessárias para uma consulta reduz drasticamente a quantidade de dados escaneados, melhorando o desempenho. A partição dos dados por data no S3 otimiza ainda mais as consultas diárias, pois o Redshift Spectrum pode eliminar partições não relevantes, escaneando apenas os dados do dia específico, o que é ideal para agregações diárias. Combinar arquivos CSV em um único arquivo por dia pode ser contraproducente, pois arquivos muito grandes podem dificultar a paralelização da leitura. O formato JSON não é colunar, o que não resolveria o problema de escaneamento excessivo de colunas. Carregar JSON em uma coluna SUPER do Redshift é para dados semiestruturados dentro do Redshift, não para otimizar o Redshift Spectrum em dados externos.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão