Um engenheiro de dados deve carregar arquivos .csv estruturados (15 colunas) em um data lake no Amazon S3. Os analistas executam consultas do Amazon Athena que geralmente referenciam apenas uma ou duas colunas e raramente examinam o arquivo inteiro. Qual abordagem é a mais econômica?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Criar um trabalho de extração, transformação e carregamento (ETL) do AWS Glue para ler da fonte de dados estruturados .csv. Configurar o trabalho para gravar os dados no data lake em formato Apache Parquet..
Por que esta é a resposta
A abordagem mais econômica é usar o formato Apache Parquet. Parquet é um formato de armazenamento de dados colunar, otimizado para consultas analíticas como as do Amazon Athena. Como os analistas consultam apenas uma ou duas colunas, o Athena pode ler apenas os dados dessas colunas, reduzindo a quantidade de dados escaneados e, consequentemente, os custos. Além disso, Parquet oferece compressão eficiente, o que economiza espaço de armazenamento no S3. As opções que utilizam .csv ou JSON não são ideais porque são formatos baseados em linha. Isso significa que, mesmo que apenas algumas colunas sejam necessárias, o Athena precisaria escanear o arquivo inteiro, aumentando os custos e o tempo de consulta. Apache Avro é um formato de linha e não oferece as mesmas otimizações colunares para consultas seletivas que o Parquet.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão