Um parceiro externo envia diariamente arquivos CSV com algumas linhas malformadas para o GCS. Você precisa carregar esses dados no BigQuery e inspecionar as linhas inválidas. Qual design de pipeline é apropriado?
Escolha uma resposta
Toque em uma opção para verificar sua resposta.
Resposta correta: Execute um pipeline de lote do Google Cloud Dataflow para importar os dados para o BigQuery e envie os erros para outra tabela de "dead-letter" para análise..
Por que esta é a resposta
A opção correta é usar um pipeline do Google Cloud Dataflow. O Dataflow permite processar os dados, identificar linhas malformadas e direcioná-las para uma tabela de "dead-letter" (erros) para análise posterior, enquanto os dados válidos são carregados no BigQuery. Isso atende ao requisito de carregar os dados e inspecionar as linhas inválidas. Fontes de dados federadas não resolvem o problema de linhas malformadas, apenas permitem consultar dados externos. O monitoramento do BigQuery no Stackdriver é para desempenho e uso, não para validação de dados em nível de linha. Definir maxbadrecords como 0 com a CLI gcloud faria com que o carregamento falhasse completamente ao encontrar a primeira linha inválida, impedindo o carregamento dos dados válidos e a inspeção dos inválidos.
Passe no seu exame — sem a busca interminável por respostas
Obtenha todas as perguntas e explicações verificadas para este exame em um só lugar e economize horas de preparação. Mais de 1.000 certificações · Mais de 20 idiomas · Grátis para começar.
Passe no seu exame mais rápido → Não é necessário cartão