Zadanie Dataproc Spark z wieloma operacjami shuffle odczytuje pliki parquet o rozmiarze ~200–400 MB każdy i działa na prewencyjnych workerach z tylko dwoma węzłami nieprewencyjnymi. Aby poprawić wydajność w sposób efektywny kosztowo, jaką zmianę należy wprowadzić?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Przejdź z dysków HDD na SSD, zastąp konfigurację prewencyjnych maszyn wirtualnych, aby zwiększyć rozmiar dysku rozruchowego..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to "Przejdź z dysków HDD na SSD, zastąp konfigurację prewencyjnych maszyn wirtualnych, aby zwiększyć rozmiar dysku rozruchowego." Dyski SSD oferują znacznie wyższą wydajność I/O niż HDD, co jest kluczowe dla zadań Spark z wieloma operacjami shuffle, które intensywnie korzystają z dysku. Zwiększenie rozmiaru dysku rozruchowego na maszynach prewencyjnych zapewnia więcej miejsca na dane tymczasowe Sparka i poprawia stabilność. Pozostałe opcje są mniej efektywne kosztowo lub nie rozwiązują problemu: Zwiększenie rozmiaru plików Parquet do 1 GB może poprawić wydajność odczytu, ale nie adresuje problemu I/O związanego z operacjami shuffle. Przejście na TFRecords nie jest uzasadnione, ponieważ Parquet jest już zoptymalizowany pod kątem Sparka i nie rozwiąże problemu I/O. Kopiowanie danych z GCS do HDFS i z powrotem wprowadza dodatkowy narzut i złożoność, co jest nieefektywne kosztowo i czasochłonne.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana