Você precisa de um pipeline de ingestão e análise em tempo real, sem servidor, para eventos JSON de streaming de alto volume. O pipeline deve armazenar dados em buffer, converter JSON para um formato colunar otimizado para consultas sem perda de dados, armazenar os resultados em um armazenamento de dados altamente disponível e permitir que os analistas executem consultas SQL e conectem painéis de BI. Qual design melhor atende a esses requisitos?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Defina um esquema em um Data Catalog gerenciado para o formato de entrada. Use um serviço de entrega de streaming gerenciado para ingerir os eventos, transformá-los para um formato colunar (Parquet ou ORC) usando o Data Catalog e entregar os resultados para o armazenamento de objetos. Permita que os analistas consultem o armazenamento de objetos usando um mecanismo de consulta SQL sem servidor e conectem ferramentas de BI com seu conector JDBC..
Por que esta é a resposta
A opção correta atende a todos os requisitos: um serviço de entrega de streaming gerenciado (como o Amazon Kinesis Data Firehose) ingere os dados, armazena em buffer e os converte para um formato colunar otimizado para consulta (Parquet/ORC) usando um Data Catalog (como o AWS Glue Data Catalog) para schema management. Os dados são armazenados em um armazenamento de objetos altamente disponível (Amazon S3). Um mecanismo de consulta SQL sem servidor (Amazon Athena) permite consultas e integração com ferramentas de BI. As opções incorretas falham em aspectos importantes: A segunda opção, ao usar eventos de armazenamento de objetos para acionar uma função sem servidor para cada registro, pode ser ineficiente para alto volume e não lida com o armazenamento em buffer de forma nativa. A terceira opção, ao inserir em um banco de dados relacional, pode não ser ideal para o volume e a natureza dos dados de streaming, além de não ser um armazenamento de dados colunar otimizado para consultas analíticas de grande escala. A quarta opção, embora use um serviço de processamento de fluxo SQL, não menciona explicitamente o uso de um Data Catalog para gerenciamento de esquema, o que é crucial para transformações sem perda de dados e para a capacidade de consulta posterior.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão