Inżynier ML musi scalać i przetwarzać cotygodniowe dane z dwóch źródeł: dużych plików CSV w S3 (każdy z milionami wierszy) oraz klastra Amazon Aurora. Scalone dane wyjściowe muszą zostać zapisane do innego zasobnika S3. Która opcja zapewnia to przy NAJMNIEJSZYM narzucie operacyjnym?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Zaplanuj cotygodniowe zadanie AWS Glue, używając silnika Apache Spark i operacji DynamicFrame do scalenia i przetworzenia danych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to zaplanowanie cotygodniowego zadania AWS Glue. AWS Glue to bezserwerowa usługa ETL, która automatycznie skaluje się i zarządza infrastrukturą bazową, minimalizując narzut operacyjny. Użycie silnika Apache Spark i DynamicFrame w Glue jest efektywne do przetwarzania dużych zbiorów danych z S3 i Aurora. Uruchamianie tymczasowego klastra Amazon EMR wymaga ręcznego zarządzania klastrem i jego konfiguracją, co zwiększa narzut operacyjny. Funkcja AWS Lambda ma ograniczenia czasowe i pamięciowe, co czyni ją nieodpowiednią do uruchamiania zadań Spark na milionach wierszy. AWS Batch wymaga zarządzania instancjami EC2 i konfiguracją środowiska Spark, co również zwiększa narzut operacyjny w porównaniu do Glue.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana