Musisz zbudować potok ETL, który pobiera pliki (CSV, JSON lub Parquet) dostarczane co 15 minut z 10 systemów źródłowych do 10 tabel Amazon Redshift. Wszystkie pliki trafiają do jednego zasobnika S3; rozmiary plików wahają się od 10 MB do 20 GB. Potok musi tolerować zmiany schematu. Które rozwiązania spełniają te wymagania? (Wybierz dwie opcje.)
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj reguły Amazon EventBridge, aby wywoływać zadanie workflow AWS Glue co 15 minut. Skonfiguruj workflow AWS Glue tak, aby miało wyzwalacz na żądanie, który uruchamia AWS Glue crawler, a następnie uruchamia zadanie AWS Glue po pomyślnym zakończeniu działania crawlera. Skonfiguruj zadanie AWS Glue tak, aby przetwarzało i ładowało dane do tabel Amazon Redshift., Skonfiguruj funkcję AWS Lambda, aby wywoływała workflow AWS Glue, gdy plik zostanie załadowany do zasobnika S3. Skonfiguruj workflow AWS Glue tak, aby miało wyzwalacz na żądanie, który uruchamia AWS Glue crawler, a następnie uruchamia zadanie AWS Glue po pomyślnym zakończeniu działania crawlera. Skonfiguruj zadanie AWS Glue tak, aby przetwarzało i ładowało dane do tabel Amazon Redshift..
Dlaczego to jest odpowiedź
Obie poprawne opcje wykorzystują AWS Glue Workflow, które jest idealne do orkiestracji złożonych potoków ETL, w tym uruchamiania crawlera i zadania Glue w sekwencji. Crawler AWS Glue automatycznie wykrywa schematy i zmiany schematów w plikach, co jest kluczowe dla tolerancji zmian schematu. Zadanie AWS Glue może następnie przetwarzać i ładować dane do Amazon Redshift. Pierwsza opcja używa EventBridge do uruchamiania co 15 minut, spełniając wymóg harmonogramu. Druga opcja używa Lambda wyzwalanej przez S3, co jest odpowiednie, gdy pliki są dostarczane asynchronicznie. Pierwsza niepoprawna opcja pomija crawlera AWS Glue, co uniemożliwiłoby tolerowanie zmian schematu. Trzecia niepoprawna opcja jest zbyt skomplikowana i niepotrzebnie rozdziela logikę na wiele funkcji Lambda i EventBridge, podczas gdy AWS Glue Workflow może to obsłużyć efektywniej. Ostatnia niepoprawna opcja wprowadza Kinesis Data Firehose, które nie jest optymalne dla plików o rozmiarach do 20 GB i nie jest wymagane do obsługi zmian schematu w ten sposób.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana