Inżynier danych wyodrębnia miesięczne dane szkoleniowe z Amazon Redshift do Amazon S3. Schemat źródłowy zawiera TransactionTimestamp (timestamp), CardName (varchar) i CardNo (varchar). Inżynier musi (1) usunąć wiersze z CardNo = NULL, (2) podzielić TransactionTimestamp na TransactionDate i TransactionTime oraz (3) zmienić nazwę CardName na NameOnCard. Rozwiązanie musi minimalizować konfigurację infrastruktury, być automatyzowane co miesiąc i minimalnie obciążać klaster Redshift. Które rozwiązanie spełnia te wymagania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz zadanie AWS Glue, które używa klastra Amazon Redshift jako źródła i zasobnika S3 jako celu. Użyj wbudowanych transformacji Glue (Filter, Map, RenameField), aby zastosować wymagane zmiany i zaplanuj zadanie co miesiąc..
Dlaczego to jest odpowiedź
Rozwiązanie AWS Glue jest najbardziej odpowiednie, ponieważ minimalizuje konfigurację infrastruktury (jest to usługa bezserwerowa), umożliwia automatyzację miesięcznych zadań i oferuje wbudowane transformacje (Filter, Map, RenameField), które bezpośrednio odpowiadają wymaganiom (usunięcie wierszy z CardNo = NULL, podział TransactionTimestamp, zmiana nazwy CardName). Użycie AWS Glue do odczytu danych z Redshift i zapisu do S3 jest standardowym i efektywnym podejściem ETL. Uruchomienie klastra Amazon EMR jest zbyt obciążające pod względem zarządzania infrastrukturą. Zapytania z instancji EC2 wymagają ręcznego zarządzania instancją i klientem SQL, co jest sprzeczne z minimalizacją konfiguracji i automatyzacją. Amazon Redshift Spectrum służy do odpytywania danych w S3, a nie do eksportowania przetworzonych danych z Redshift do S3 z transformacjami, które wymagają logiki ETL.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana