Masz lokalne zadania Spark przetwarzające pliki Parquet codziennie. Migrując do Google Cloud, chcesz korzystać z usług zarządzanych, minimalnych zmian ETL i dostępności BigQuery dla przyszłych potoków. Co powinieneś zrobić?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Migruj dane do Cloud Storage i migruj metadane do Dataproc Metastore (DPMS). Przeprojektuj zadania Spark, aby odczytywały/zapisywały Cloud Storage i uruchamiaj je na Dataproc Serverless..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to migracja danych do Cloud Storage i metadanych do Dataproc Metastore (DPMS), a następnie uruchamianie przeprojektowanych zadań Spark na Dataproc Serverless. Cloud Storage jest skalowalnym i ekonomicznym miejscem do przechowywania plików Parquet, a Dataproc Metastore zapewnia zarządzaną usługę metadanych Hive, co minimalizuje zmiany w istniejących zadaniach Spark. Dataproc Serverless umożliwia uruchamianie zadań Spark bez zarządzania infrastrukturą, co jest zgodne z wymogiem korzystania z usług zarządzanych. Pozostałe opcje są mniej optymalne: Rejestracja zasobnika jako zasobu Dataplex jest możliwa, ale Dataproc Metastore jest bardziej bezpośrednim rozwiązaniem dla metadanych Spark. Migracja danych bezpośrednio do BigQuery wymagałaby znacznego przeprojektowania zadań Spark, co jest sprzeczne z celem minimalnych zmian ETL. BigLake to technologia BigQuery do zapytań o dane w Cloud Storage, a nie miejsce do przechowywania danych. Użycie Dataproc on Compute Engine wymagałoby zarządzania maszynami wirtualnymi, co nie jest zgodne z preferencjami usług zarządzanych.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana