Uma empresa armazena dados de treinamento em arquivos JSON aninhados no S3 e precisa de um formato tabular para o treinamento do XGBoost. Qual abordagem tem a menor sobrecarga operacional para converter esses arquivos JSON em dados tabulares?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Criar um job AWS Glue PySpark que usa a transformação Relationalize para converter os arquivos..
Por que esta é a resposta
A abordagem de menor sobrecarga operacional é criar um job AWS Glue PySpark que usa a transformação Relationalize. O AWS Glue é um serviço de ETL sem servidor que gerencia a infraestrutura subjacente, e a transformação Relationalize é projetada especificamente para achatar dados JSON aninhados em um formato tabular, minimizando o esforço de codificação manual. Escrever código Scala personalizado com Amazon EMR Serverless exigiria mais desenvolvimento e gerenciamento de código. Uma função AWS Lambda com reduce() seria ineficiente para grandes volumes de dados e dados aninhados complexos, podendo exceder os limites de tempo e memória do Lambda. Criar um banco de dados Athena e usar flatten é uma opção viável para consulta, mas para a conversão e persistência de dados tabulares para treinamento, o Glue com Relationalize é mais adequado e otimizado para ETL.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão