Uma empresa tem três subsidiárias usando diferentes mecanismos de armazenamento (Amazon Redshift, Teradata Vantage no AWS e Google BigQuery). Elas querem consolidar dados em um data lake S3 usando Apache Iceberg. O novo pipeline deve se conectar a cada fonte, executar transformações usando cada mecanismo de origem, unir os resultados e gravar no Iceberg com o mínimo esforço operacional. Qual abordagem atende a esses requisitos com a menor sobrecarga operacional?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Use os conectores de consulta federada do Amazon Athena para Amazon Redshift, Teradata e BigQuery para construir o pipeline no Athena. Escreva uma consulta SQL para ler de todas as fontes de dados, unir os dados e executar uma operação Merge na tabela Iceberg do data lake..
Por que esta é a resposta
A abordagem do Amazon Athena com consulta federada é a mais eficiente operacionalmente. O Athena pode se conectar diretamente a Redshift, Teradata (via JDBC) e BigQuery (via conectores federados), permitindo que você consulte e una dados de todas as fontes usando SQL padrão. Isso minimiza o desenvolvimento de código e a sobrecarga de gerenciamento de infraestrutura, pois o Athena é serverless. A capacidade de executar uma operação MERGE diretamente na tabela Iceberg do data lake simplifica ainda mais o processo de atualização. As outras opções envolvem maior complexidade. AWS Glue exigiria desenvolvimento de scripts e gerenciamento de jobs. Amazon EMR exige provisionamento e gerenciamento de clusters. Amazon AppFlow é mais para replicação de dados e não para transformações e junções complexas em tempo real.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão