Potrzebujesz potoku do kopiowania danych transakcyjnych szeregów czasowych do BigQuery w celu analizy. Początkowy rozmiar zbioru danych wynosi 1,5 PB, rośnie o 3 TB dziennie; tysiące transakcji jest aktualizowanych co godzinę o nowy status. Dane są silnie ustrukturyzowane i wykorzystywane do uczenia maszynowego. Aby zmaksymalizować wydajność i użyteczność, które dwie strategie przyjmiesz?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Denormalizuj dane w jak największym stopniu., Opracuj potok danych, w którym aktualizacje statusu są dołączane do BigQuery zamiast aktualizowania..
Dlaczego to jest odpowiedź
Denormalizacja danych w BigQuery poprawia wydajność zapytań, ponieważ zmniejsza liczbę kosztownych operacji łączenia (JOIN), co jest kluczowe dla dużych zbiorów danych i zastosowań uczenia maszynowego. Dołączanie aktualizacji statusu zamiast ich aktualizowania (UPDATE) jest znacznie bardziej wydajne w BigQuery, zwłaszcza przy dużej częstotliwości zmian. Operacje UPDATE w BigQuery są kosztowne i mogą prowadzić do fragmentacji tabel, obniżając wydajność. Zachowanie struktury danych w dużym stopniu (normalizacja) zwiększyłoby liczbę złączeń, co obniżyłoby wydajność. Użycie BigQuery UPDATE nie zmniejszy rozmiaru zbioru danych, a wręcz przeciwnie, może zwiększyć koszty i złożoność. Kopiowanie codziennej migawki do Cloud Storage i używanie zewnętrznych źródeł danych BigQuery byłoby nieefektywne dla danych aktualizowanych co godzinę, ponieważ opóźnienie byłoby zbyt duże, a wydajność zapytań na zewnętrznych danych jest zazwyczaj niższa niż na danych natywnych BigQuery.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana