Uma empresa tem uma pasta S3 que contém tipos de arquivo mistos (CSV, JSON, XLSX e Apache Parquet). Um engenheiro de ML usará o AWS Glue DataBrew para processar os dados e deve salvar a saída final de volta no S3 para que o AWS Glue possa consumi-la posteriormente. Qual abordagem satisfaz esses requisitos?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Separe os arquivos em pastas distintas por tipo de arquivo, processe cada pasta com o DataBrew e grave as saídas no formato Apache Parquet..
Por que esta é a resposta
A abordagem correta é separar os arquivos por tipo em pastas distintas, processar cada pasta com o DataBrew e salvar a saída em Apache Parquet. O AWS Glue DataBrew funciona melhor quando os dados de entrada em um conjunto de dados são de um tipo de arquivo consistente. Embora o DataBrew possa processar pastas com tipos de arquivo mistos, isso pode levar a erros ou processamento inconsistente se o esquema inferido não for adequado para todos os tipos. Separar os arquivos garante que o DataBrew possa inferir o esquema correto para cada tipo de arquivo e processá-los de forma eficiente. Salvar a saída em Apache Parquet é ideal porque é um formato de coluna otimizado para análise e é amplamente compatível com o AWS Glue e outros serviços de análise, tornando-o eficiente para consumo posterior. As opções que não separam os arquivos por tipo são menos robustas devido à inconsistência de esquema. O formato "AWS Glue Parquet" não é um formato de arquivo distinto; Apache Parquet é o formato padrão.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão