Você deseja reconstruir um pipeline de lote PySpark lento usando uma abordagem serverless baseada em SQL. Os dados brutos estão no Cloud Storage. Como você deve implementar o pipeline para acelerar o desenvolvimento e o tempo de execução?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Carregue os dados no BigQuery do Cloud Storage, traduza as transformações PySpark para BigQuery SQL e grave os resultados em uma nova tabela do BigQuery..
Por que esta é a resposta
A melhor abordagem para um pipeline serverless baseado em SQL é carregar os dados brutos do Cloud Storage diretamente no BigQuery. Em seguida, as transformações PySpark podem ser traduzidas para BigQuery SQL, aproveitando a capacidade de processamento distribuído e serverless do BigQuery. Isso acelera o desenvolvimento, pois o SQL é mais direto para transformações de dados, e o tempo de execução, devido à otimização inerente do BigQuery para grandes volumes de dados. A saída é gravada em uma nova tabela do BigQuery, mantendo a consistência do ecossistema. Converter PySpark para SparkSQL no Dataproc ainda envolve um cluster gerenciado, não sendo totalmente serverless. Ingerir dados no Cloud SQL é inadequado para grandes volumes de dados e não é serverless para transformações. Reimplementar com Apache Beam Python SDK é uma solução serverless, mas não é baseada em SQL, o que não atende ao requisito da pergunta.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão