Firma uruchamia codzienny potok ETL zaimplementowany jako skrypty Pythona na dużej instancji EC2 w celu czyszczenia, transformacji, wzbogacania i kompresowania terabajtów danych interakcji użytkowników przechowywanych w S3. Proces trwa ponad 20 godzin, a firma chce przenieść się z EC2 na zarządzane, bezserwerowe rozwiązanie przy minimalnym wysiłku deweloperskim. Które podejście spełnia te wymagania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz zadanie AWS Glue, przekonwertuj skrypty na PySpark, uruchom zadanie Glue, aby przetworzyć dane i przechowuj wyniki w S3..
Dlaczego to jest odpowiedź
AWS Glue to w pełni zarządzana usługa ETL, która doskonale nadaje się do przetwarzania terabajtów danych z minimalnym wysiłkiem deweloperskim. Konwersja skryptów Pythona na PySpark umożliwia wykorzystanie rozproszonych możliwości przetwarzania Glue, co znacząco skraca czas wykonania. Pozostałe opcje są mniej odpowiednie: Amazon Redshift wymaga ładowania danych i użycia SQL, co może być trudne przy istniejących skryptach Pythona. DynamoDB nie jest przeznaczone do przetwarzania terabajtów danych w ramach ETL. Rozdzielenie skryptów na wiele funkcji Lambda i orkiestracja za pomocą Step Functions jest możliwe, ale może być bardziej złożone w zarządzaniu i droższe dla dużych obciążeń danych niż AWS Glue.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana