Zewnętrzny partner codziennie przesyła do GCS pliki CSV zawierające nieprawidłowo sformatowane wiersze. Musisz załadować je do BigQuery i sprawdzić błędne wiersze. Jaki projekt potoku jest odpowiedni?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uruchom potok wsadowy Google Cloud Dataflow, aby zaimportować dane do BigQuery, i przekaż błędy do innej tabeli dead-letter w celu analizy..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to uruchomienie potoku wsadowego Google Cloud Dataflow, aby zaimportować dane do BigQuery, i przekazanie błędów do innej tabeli dead-letter w celu analizy. Dataflow, oparty na Apache Beam, jest idealny do transformacji i walidacji danych na dużą skalę. Pozwala na elastyczne przetwarzanie rekordów, identyfikowanie błędów i kierowanie ich do tabeli dead-letter, co umożliwia późniejszą analizę bez przerywania ładowania poprawnych danych. Użycie sfederowanych źródeł danych nie rozwiązuje problemu nieprawidłowo sformatowanych wierszy, ponieważ BigQuery nadal będzie próbował przetworzyć wszystkie dane. Włączenie monitorowania BigQuery w Google Stackdriver i utworzenie alertu powiadomiłoby o błędach, ale nie rozwiązałoby problemu ich izolacji i analizy. Zaimportowanie danych za pomocą gcloud CLI z maxbadrecords ustawionym na 0 spowodowałoby odrzucenie całego zadania ładowania przy napotkaniu pierwszego błędu, co jest nieefektywne, gdy chcemy załadować poprawne dane i zbadać tylko błędne wiersze.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana