Uma empresa deseja executar análises de ML em dados em um data lake S3. Eles têm duas necessidades de transformação: (1) realizar transformações diárias agendadas em 300 GB de dados de vários formatos que chegam em um horário definido e (2) executar uma transformação única em terabytes de dados arquivados no lake. Os DAGs do Amazon MWAA orquestrarão os fluxos de trabalho. Quais duas tarefas os DAGs devem agendar para atender a essas necessidades da forma mais econômica? (Escolha duas.)
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Para dados diários de entrada, use AWS Glue crawlers para escanear e identificar o esquema., Para dados diários e arquivados, use Amazon EMR para realizar transformações de dados..
Por que esta é a resposta
Para dados diários de entrada, usar AWS Glue crawlers é a opção mais econômica e eficiente para escanear e identificar o esquema. Crawlers automatizam a descoberta de esquema e metadados de dados em vários formatos no S3, populando o AWS Glue Data Catalog, que é essencial para consultas e processamento subsequentes. O Amazon Athena não é uma ferramenta para escanear e identificar esquemas; ele é um serviço de consulta interativa. O Amazon Redshift é um data warehouse, não ideal para transformações em data lakes. Para transformações de dados diários e arquivados, o Amazon EMR é a escolha mais adequada. Ele oferece uma plataforma flexível e escalável para processamento de big data usando frameworks como Spark e Hive, sendo eficaz para lidar com volumes de dados de terabytes e transformações complexas. O Amazon SageMaker é uma plataforma de ML, não otimizada para transformações gerais de dados em larga escala.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão