Um engenheiro de ML deve processar milhares de arquivos CSV existentes, além de novos uploads de CSV armazenados em um bucket S3 central. Todos os CSVs compartilham o mesmo layout de coluna e incluem uma coluna de data de transação que deve ser consultada. Qual solução oferece isso com o menor overhead operacional?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Execute um Amazon Athena CREATE TABLE AS SELECT (CTAS) para construir uma tabela (particionada ou filtrada por data de transação) sobre os dados do S3 e, em seguida, consulte essa tabela..
Por que esta é a resposta
A opção correta é usar Amazon Athena com CTAS. O Athena permite consultar diretamente os dados no S3 usando SQL, sem a necessidade de provisionar ou gerenciar servidores, minimizando o overhead operacional. O CTAS pode criar uma nova tabela particionada ou filtrada por data de transação, otimizando futuras consultas e reduzindo custos ao escanear menos dados. As outras opções são menos eficientes: Usar S3 Object Lambda para consultar por data de transação exigiria lógica personalizada para cada consulta e não otimizaria o escaneamento de dados como o particionamento. Um trabalho do AWS Glue para Apache Spark seria mais complexo e custoso para gerenciar, além de ser um processo ETL completo quando uma consulta direta é suficiente. O Amazon Kinesis Data Firehose com uma função Lambda é projetado para ingestão e transformação de dados em tempo real, não para consultar dados históricos existentes de forma eficiente.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão