Uma empresa aumentou muito o volume de arquivos CSV armazenados em um bucket do Amazon S3. Os scripts e as consultas de transformação de dados ficaram muito mais lentos. Um engenheiro de ML deve implementar uma solução que otimize os dados para o desempenho da consulta com o MÍNIMO de sobrecarga operacional. Qual opção satisfaz esse requisito?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Configurar um job de extract, transform, and load (ETL) do AWS Glue para converter os arquivos .csv para o formato Apache Parquet..
Por que esta é a resposta
A opção correta é configurar um job ETL do AWS Glue para converter os arquivos .csv para o formato Apache Parquet. O Parquet é um formato de armazenamento colunar otimizado para desempenho de consulta analítica, pois permite que os motores de consulta leiam apenas as colunas necessárias, reduzindo a quantidade de dados escaneados. O AWS Glue é um serviço sem servidor, minimizando a sobrecarga operacional. As outras opções são menos ideais: Dividir arquivos .csv em objetos menores pode aumentar o número de objetos e a sobrecarga de metadados, sem necessariamente otimizar a leitura colunar. Descartar colunas com valores string pode resultar em perda de dados importantes e não aborda a otimização fundamental do formato de armazenamento. Configurar um cluster do Amazon EMR envolve gerenciar servidores, o que aumenta significativamente a sobrecarga operacional em comparação com o AWS Glue sem servidor.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão