Uma empresa tem de 10 a 15 TB de arquivos .csv não compactados no Amazon S3 e planeja executar uma avaliação única usando o Amazon Athena. A empresa deseja transformar os dados para reduzir os tempos de consulta e diminuir os custos de armazenamento. Qual formato de arquivo e escolha de compactação melhor satisfazem esses requisitos para consultas do Athena?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Formato Apache Parquet compactado com Snappy.
Por que esta é a resposta
O formato Apache Parquet com compactação Snappy é a melhor escolha porque o Parquet é um formato de armazenamento de dados colunar otimizado para consultas analíticas. Isso significa que o Athena pode ler apenas as colunas necessárias para uma consulta, reduzindo significativamente a quantidade de dados escaneados e, consequentemente, os tempos de consulta e os custos. A compactação Snappy oferece um bom equilíbrio entre taxa de compactação e desempenho de descompactação, sendo ideal para cargas de trabalho analíticas. As outras opções são menos eficientes: .csv compactado com zip ainda é um formato baseado em linha, o que significa que o Athena precisaria ler todas as linhas para acessar dados em colunas específicas. JSON compactado com bzip2 é um formato semiestruturado e bzip2 é mais lento para descompactar, impactando o desempenho. Avro com LZO é um formato baseado em linha e LZO, embora rápido, não oferece as vantagens de um formato colunar para consultas analíticas.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão