Uma empresa usa o Amazon S3 como data lake e um cluster Amazon Redshift de vários nós como data warehouse. Os arquivos de dados no lake são organizados por sua origem, e a empresa atualmente emite um comando COPY separado para cada local de arquivo para carregar em uma única tabela do Redshift, o que é lento. A empresa precisa acelerar a ingestão sem aumentar os custos. O que eles devem fazer?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Crie um arquivo de manifesto que contenha os locais dos arquivos de dados. Use um comando COPY para carregar os dados no Amazon Redshift..
Por que esta é a resposta
A criação de um arquivo de manifesto permite que o comando COPY do Amazon Redshift carregue dados de vários arquivos ou pastas S3 em uma única operação, melhorando significativamente a velocidade de ingestão em comparação com comandos COPY separados. Isso evita o overhead de múltiplas operações e otimiza o uso dos recursos do Redshift. Usar um cluster EMR ou um trabalho do AWS Glue para copiar arquivos para uma única pasta adiciona uma etapa de processamento desnecessária e custos adicionais, sem resolver a ineficiência do comando COPY. Carregar dados no Amazon Aurora e depois usar o AWS Glue para o Redshift introduz complexidade e custos extras, além de não ser a forma mais direta de otimizar a ingestão do S3 para o Redshift.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão