Ein externer Partner legt täglich CSV-Dateien mit einigen fehlerhaften Zeilen in GCS ab. Sie müssen diese in BigQuery laden und die fehlerhaften Zeilen überprüfen. Welches Pipeline-Design ist geeignet?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Führen Sie eine Google Cloud Dataflow-Batch-Pipeline aus, um die Daten in BigQuery zu importieren, und leiten Sie Fehler zur Analyse an eine andere Dead-Letter-Tabelle weiter..
Warum dies die Antwort ist
Die Verwendung einer Google Cloud Dataflow-Batch-Pipeline ist die geeignetste Lösung. Dataflow ermöglicht es, die CSV-Dateien zu lesen, die Daten zu transformieren und in BigQuery zu laden. Fehlerhafte Zeilen können dabei abgefangen und in eine separate Dead-Letter-Tabelle umgeleitet werden. Dies ermöglicht eine detaillierte Analyse der fehlerhaften Daten, ohne den Ladevorgang der gültigen Daten zu blockieren. Föderierte Datenquellen sind nicht ideal, da sie keine direkte Möglichkeit bieten, fehlerhafte Zeilen während des Ladevorgangs zu isolieren und zu analysieren. BigQuery-Monitoring in Stackdriver würde nur auf Fehler hinweisen, aber nicht die fehlerhaften Zeilen selbst zur Analyse bereitstellen. Das Setzen von maxbadrecords auf 0 mit der gcloud CLI würde den gesamten Ladevorgang bei der ersten fehlerhaften Zeile abbrechen, anstatt die guten Daten zu laden und die schlechten zu isolieren.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich