Firma buduje platformę analityczną, wykorzystując Amazon S3 jako jezioro danych i Amazon Redshift jako hurtownię danych. Firma zamierza używać Amazon Redshift Spectrum do wykonywania zapytań na danych w S3. Które działania ZAPEWNIĄ NAJSZYBSZĄ wydajność zapytań? (Wybierz dwie odpowiedzi.)
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj kolumnowego formatu przechowywania plików., Podziel dane na partycje w oparciu o najczęściej używane predykaty zapytań..
Dlaczego to jest odpowiedź
Użycie kolumnowego formatu przechowywania plików (np. Parquet, ORC) jest kluczowe, ponieważ Redshift Spectrum odczytuje tylko te kolumny, które są potrzebne do zapytania, co minimalizuje ilość skanowanych danych i przyspiesza wykonanie. Partycjonowanie danych na podstawie często używanych predykatów zapytań (np. data, region) pozwala Redshift Spectrum na pominięcie skanowania dużych części danych, które nie spełniają warunków zapytania, co znacząco redukuje czas i koszty. Kompresja gzip jest dobra, ale pliki 1-5 GB mogą być zbyt duże dla optymalnej równoległości, a mniejsze pliki (poniżej 10 KB) generują zbyt duży narzut. Niesplittable formaty plików uniemożliwiają równoległe przetwarzanie, co spowalnia zapytania.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana