Po wdrożeniu nowej wersji potoku pozyskiwania danych, dzienna ilość danych przechowywanych w BigQuery wzrosła o 50%, wolumeny Pub/Sub pozostały niezmienione, a tylko niektóre dzienne partycje podwoiły swoją wielkość. Jak zbadać i naprawić przyczynę?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: 1. Sprawdź duplikaty wierszy w tabelach BigQuery, w których dzienna partycja danych podwoiła swoją wielkość. 2. Sprawdź dzienniki audytu BigQuery, aby znaleźć identyfikatory zadań. 3. Użyj Cloud Monitoring, aby określić, kiedy zidentyfikowane zadania Dataflow zostały uruchomione i jaka była wersja kodu potoku. 4. Gdy więcej niż jeden potok pozyskuje dane do tabeli, zatrzymaj wszystkie wersje z wyjątkiem najnowszej..
Dlaczego to jest odpowiedź
Poprawna odpowiedź koncentruje się na identyfikacji i rozwiązaniu problemu duplikacji danych. Wzrost danych o 50% przy niezmienionych wolumenach Pub/Sub i podwojonych niektórych partycjach BigQuery silnie sugeruje duplikację. Sprawdzenie duplikatów w BigQuery jest pierwszym krokiem. Dzienniki audytu BigQuery pomogą zidentyfikować zadania odpowiedzialne za zapisy. Cloud Monitoring pozwoli ustalić, które wersje potoków Dataflow były aktywne w momencie wystąpienia problemu. Zatrzymanie starszych wersji potoków, które mogły działać równolegle z nową, jest kluczowe, aby zapobiec dalszej duplikacji. Pozostałe opcje są mniej skuteczne: Opcja 1 (deduplikacja SQL) jest rozwiązaniem objawu, a nie przyczyny. Opcja 2 (sprawdzenie błędów, przywracanie) nie adresuje bezpośrednio problemu duplikacji i może być zbyt drastyczna bez zrozumienia przyczyny. Opcja 4 (wycofanie, odtwarzanie) jest również drastyczna i może prowadzić do utraty danych lub opóźnień w przetwarzaniu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana