Zadanie ETL musi przetwarzać codzienne pliki .csv, które użytkownicy umieszczają w zasobniku S3. Każdy plik jest mniejszy niż 100 MB. Która implementacja jest najbardziej opłacalna?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Napisz zadanie AWS Glue Python shell. Użyj pandas do transformacji danych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź to „Napisz zadanie AWS Glue Python shell. Użyj pandas do transformacji danych.” Zadania AWS Glue Python shell są najbardziej opłacalne dla małych obciążeń, takich jak pliki CSV o rozmiarze mniejszym niż 100 MB, ponieważ płacisz tylko za czas wykonania skryptu Python. Biblioteka pandas jest idealna do transformacji danych w pamięci dla takich rozmiarów plików. Pozostałe opcje są mniej opłacalne: Niestandardowa aplikacja w Pythonie na Amazon EKS wymaga zarządzania klastrem Kubernetes i jest bardziej złożona i kosztowna. Skrypt PySpark na Amazon EMR jest przeznaczony do dużych zbiorów danych i rozproszonego przetwarzania, co jest nadmierne i droższe dla małych plików. Zadanie AWS Glue PySpark również wykorzystuje Apache Spark, co jest efektywne dla dużych danych, ale nieoptymalne kosztowo dla małych plików w porównaniu do Python shell.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana