Będziesz budować model za pomocą BigQuery ML i hostować go na Vertex AI. Strumienie od dostawców napływają w sposób ciągły i mogą zawierać nieprawidłowe wartości. Co należy zrobić w celu przetwarzania i sanityzacji danych w czasie zbliżonym do rzeczywistego przed BigQuery?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz temat Pub/Sub i wyślij do niego wszystkie dane od dostawców. Użyj Dataflow do przetwarzania i sanityzacji danych z Pub/Sub oraz przesyłania ich strumieniowo do BigQuery..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to użycie Pub/Sub i Dataflow. Pub/Sub jest idealny do pozyskiwania danych strumieniowych z wielu źródeł, zapewniając niezawodną kolejkę komunikatów. Dataflow, jako w pełni zarządzana usługa do przetwarzania strumieniowego i wsadowego, doskonale nadaje się do przetwarzania danych w czasie zbliżonym do rzeczywistego, w tym do sanityzacji i transformacji, zanim zostaną one przesłane strumieniowo do BigQuery. To podejście zapewnia skalowalność i elastyczność w obsłudze nieprawidłowych danych. Pozostałe opcje są mniej odpowiednie: Bezpośrednie użycie BigQuery streaming inserts bez pośredniego przetwarzania (opcje 1 i 2) nie pozwala na sanityzację danych przed ich zapisaniem, co jest kluczowym wymaganiem. Cloud Functions (opcja 3) mogą być używane do prostych transformacji, ale Dataflow jest bardziej odpowiedni dla złożonych operacji przetwarzania strumieniowego i sanityzacji na dużą skalę, oferując lepszą obsługę błędów i skalowalność.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana