Firma przechowuje dane szkoleniowe w zagnieżdżonych plikach JSON w S3 i potrzebuje formatu tabelarycznego do trenowania XGBoost. Które podejście wiąże się z najmniejszym obciążeniem operacyjnym przy konwersji tych plików JSON na dane tabelaryczne?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utworzenie zadania AWS Glue PySpark, które używa transformacji Relationalize do konwersji plików..
Dlaczego to jest odpowiedź
Utworzenie zadania AWS Glue PySpark z transformacją Relationalize jest najbardziej efektywnym operacyjnie rozwiązaniem. Transformacja Relationalize w AWS Glue jest specjalnie zaprojektowana do spłaszczania zagnieżdżonych danych JSON i przekształcania ich w format tabelaryczny, co minimalizuje potrzebę pisania skomplikowanego kodu. Napisanie niestandardowego kodu Scala i uruchomienie go na Amazon EMR Serverless wymaga większego nakładu pracy na rozwój i utrzymanie kodu. Funkcja AWS Lambda z reduce() jest mniej odpowiednia dla dużych zbiorów danych ze względu na ograniczenia czasowe i pamięciowe Lambdy. Użycie Amazon Athena do spłaszczania danych jest możliwe, ale wymagałoby ręcznego definiowania schematu i potencjalnie wielu zapytań, co jest mniej zautomatyzowane niż transformacja Relationalize w Glue.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana