Intensywnie korzystające z operacji wejścia/wyjścia na dysku zadanie Hadoop działa znacznie wolniej w Dataproc, używając Cloud Storage do przechowywania danych pośrednich, niż w przypadku lokalnego HDFS na sprzęcie fizycznym. Jak to naprawić, jednocześnie oddzielając pamięć masową od obliczeń?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Przydziel więcej dysków trwałego przechowywania i przechowuj dane pośrednie tego zadania w natywnym HDFS..
Dlaczego to jest odpowiedź
Zadania intensywnie korzystające z operacji wejścia/wyjścia na dysku, takie jak te w Hadoop, często generują duże ilości danych pośrednich. Przechowywanie tych danych w Cloud Storage, choć zapewnia oddzielenie pamięci masowej od obliczeń, może wprowadzać opóźnienia ze względu na charakter sieciowy i API. Natywny HDFS, działający na lokalnych dyskach trwałych maszyn wirtualnych Dataproc, oferuje znacznie niższą latencję i wyższą przepustowość dla danych pośrednich, co przyspiesza wykonanie zadania. Pozostałe opcje są mniej skuteczne: Zwiększenie pamięci RAM może pomóc tylko w przypadku, gdy dane pośrednie mieszczą się w pamięci, co rzadko ma miejsce w przypadku dużych zadań Hadoop. Zwiększenie liczby rdzeni procesora VM lub dodanie kart sieciowych nie rozwiązuje problemu wysokiej latencji dostępu do Cloud Storage dla danych pośrednich.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana