Firma handlowa ładuje codzienne pliki CSV z zamówieniami detalicznymi do pojedynczej ścieżki S3 i używa Amazon Redshift Spectrum do wykonywania zapytań na podzbiorach danych zawierających ponad 100 kolumn. Zewnętrzne źródło generuje ponad 30 plików CSV dziennie (każdy po 50–70 MB). Użytkownicy agregują dzienne metryki, ale wydajność zapytań uległa pogorszeniu. Która kombinacja działań rozwiąże problemy z wydajnością przy najmniejszym nakładzie pracy deweloperskiej? (Wybierz dwie.)
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Skonfiguruj aplikację zewnętrzną tak, aby generowała pliki w formacie kolumnowym., Partycjonuj dane zamówień w zasobniku S3 według daty zamówienia..
Dlaczego to jest odpowiedź
Przekształcenie plików CSV na format kolumnowy (np. Parquet lub ORC) znacznie poprawia wydajność Redshift Spectrum, ponieważ pozwala na odczytywanie tylko niezbędnych kolumn, redukując ilość skanowanych danych. Partycjonowanie danych zamówień w S3 według daty zamówienia umożliwia Redshift Spectrum odfiltrowanie niepotrzebnych partycji, co drastycznie zmniejsza ilość danych do przeskanowania, zwłaszcza przy zapytaniach o dzienne metryki. Te dwa działania minimalizują nakład pracy deweloperskiej, ponieważ wymagają głównie zmian w konfiguracji źródła danych i struktury przechowywania w S3, a nie skomplikowanych zadań ETL. Łączenie plików CSV w jeden plik dziennie (AWS Glue ETL) jest mniej efektywne niż format kolumnowy i partycjonowanie, ponieważ nadal wymaga skanowania wszystkich kolumn. Generowanie plików JSON lub ładowanie ich do kolumny SUPER w Redshift nie poprawi wydajności, a wręcz może ją pogorszyć ze względu na charakter danych i sposób ich przetwarzania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana