Chcesz przebudować wolny potok wsadowy PySpark, używając bezserwerowego podejścia opartego na SQL. Surowe dane znajdują się w Cloud Storage. Jak należy zaimplementować potok, aby przyspieszyć rozwój i czas wykonania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Załaduj dane do BigQuery z Cloud Storage, przetłumacz transformacje PySpark na BigQuery SQL i zapisz wyniki do nowej tabeli BigQuery..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to załadowanie danych do BigQuery z Cloud Storage, przetłumaczenie transformacji PySpark na BigQuery SQL i zapisanie wyników do nowej tabeli BigQuery. To podejście jest zgodne z wymaganiami bezserwerowego podejścia opartego na SQL, przyspiesza rozwój dzięki wykorzystaniu BigQuery SQL i zapewnia szybkie wykonanie dzięki skalowalności BigQuery. Konwersja PySpark na SparkSQL i uruchomienie na Dataproc nadal wymaga zarządzania klastrem. Importowanie danych do Cloud SQL nie jest optymalne dla dużych zbiorów danych i nie jest bezserwerowe w kontekście transformacji. Ponowne zaimplementowanie transformacji za pomocą Apache Beam Python SDK jest rozwiązaniem bezserwerowym, ale nie opartym na SQL, co nie spełnia wszystkich wymagań pytania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana