Firma posiada folder S3, który zawiera pliki różnych typów (CSV, JSON, XLSX i Apache Parquet). Inżynier ML użyje AWS Glue DataBrew do przetworzenia danych i musi zapisać końcowy wynik z powrotem do S3, aby AWS Glue mógł go później wykorzystać. Które podejście spełnia te wymagania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Podziel pliki na osobne foldery według typu pliku, przetwórz każdy folder za pomocą DataBrew i zapisz wyniki w formacie Apache Parquet..
Dlaczego to jest odpowiedź
AWS Glue DataBrew najlepiej działa, gdy dane wejściowe są jednorodne. Mieszanie typów plików w jednym folderze może prowadzić do problemów z przetwarzaniem i interpretacją schematu. Dzielenie plików na osobne foldery według typu (np. jeden folder dla CSV, jeden dla JSON) pozwala DataBrew na efektywne i spójne przetwarzanie każdego zestawu danych. Następnie, zapisanie wyników w formacie Apache Parquet jest optymalne, ponieważ jest to skompresowany, kolumnowy format, który jest wysoce wydajny dla analityki i integracji z AWS Glue. Opcje używające "AWS Glue Parquet" są mylące, ponieważ nie ma specyficznego formatu o takiej nazwie; Apache Parquet jest standardem.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana