Você tem jobs Spark on-prem que processam Parquet diariamente. Migrando para o Google Cloud, você deseja serviços gerenciados, alterações mínimas de ETL e disponibilidade do BigQuery para pipelines futuros. O que você deve fazer?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Migrar dados para o Cloud Storage e migrar metadados para o Dataproc Metastore (DPMS). Refatorar os jobs Spark para ler/gravar no Cloud Storage e executá-los no Dataproc Serverless..
Por que esta é a resposta
A opção correta atende a todos os requisitos. Migrar dados para o Cloud Storage mantém o formato Parquet e minimiza as alterações de ETL, pois o Spark pode lê-lo nativamente. O Dataproc Metastore (DPMS) gerencia os metadados do Hive, que o Spark utiliza. O Dataproc Serverless oferece um serviço gerenciado para jobs Spark, eliminando a necessidade de gerenciar clusters e sendo compatível com o Cloud Storage. A disponibilidade do BigQuery é garantida, pois ele pode consultar dados diretamente do Cloud Storage usando tabelas externas ou BigLake. As outras opções são menos ideais: Registrar o bucket no Dataplex não substitui a necessidade de um metastore para o Spark. Migrar dados para o BigQuery exigiria uma refatoração significativa dos jobs Spark para se adaptar ao modelo de dados do BigQuery, o que contraria o requisito de "alterações mínimas de ETL". Usar o Dataproc on Compute Engine não é um serviço totalmente gerenciado, exigindo gerenciamento de infraestrutura, e o BigLake não é um destino de migração de dados, mas uma tecnologia para acessar dados de diferentes fontes.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão