Um engenheiro de ML deve construir um pipeline que usa o Amazon Athena para duas cargas de trabalho: transformações em lote e treinamento de modelo em larga escala, e consultas de baixa latência em tempo quase real para inferência e análise. Qual formato de arquivo produzirá a MENOR latência para processamento em lote e em tempo quase real?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Apache Parquet.
Por que esta é a resposta
Apache Parquet é um formato de armazenamento de dados colunar otimizado para desempenho e eficiência. Ele oferece menor latência para processamento em lote e em tempo quase real porque permite que o Athena leia apenas as colunas necessárias para uma consulta, em vez de escanear linhas inteiras. Isso reduz significativamente a quantidade de dados lidos do armazenamento, resultando em consultas mais rápidas e custos mais baixos. CSV é um formato baseado em texto que requer o escaneamento de todas as linhas e colunas, sendo menos eficiente. Nested JSON e Deserialized JSON são formatos semi-estruturados que, embora flexíveis, são menos otimizados para consultas analíticas de larga escala e de baixa latência do que Parquet devido à sua natureza de armazenamento linha a linha e à sobrecarga de parsing.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão