Un partenaire externe dépose quotidiennement des fichiers CSV contenant des lignes mal formées dans GCS. Vous devez charger ces données dans BigQuery et inspecter les lignes incorrectes. Quelle conception de pipeline est appropriée ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Exécuter un pipeline de traitement par lots Google Cloud Dataflow pour importer les données dans BigQuery, et pousser les erreurs vers une autre table de lettres mortes pour analyse..
Pourquoi c'est la réponse
La bonne réponse est d'exécuter un pipeline Google Cloud Dataflow. Dataflow, basé sur Apache Beam, est idéal pour le traitement par lots et la transformation de données. Il permet d'ingérer des fichiers CSV, de détecter les lignes mal formées et de les diriger vers une table de "dead-letter" pour une inspection ultérieure, tout en chargeant les données valides dans BigQuery. Les sources de données fédérées ne permettent pas de gérer les erreurs de formatage des lignes de manière robuste. La surveillance BigQuery dans Stackdriver est utile pour les performances, mais pas pour la gestion des erreurs de formatage de données pendant l'ingestion. L'importation via la CLI gcloud avec maxbadrecords=0 échouerait l'importation entière à la première ligne mal formée, ce qui n'est pas l'objectif.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise