Firma używa Amazon S3 jako jeziora danych i wielowęzłowego klastra Amazon Redshift jako hurtowni danych. Pliki danych w jeziorze są uporządkowane według ich źródła, a firma obecnie wydaje oddzielne polecenie COPY dla każdej lokalizacji pliku, aby załadować je do pojedynczej tabeli Redshift, co jest powolne. Firma musi przyspieszyć ingestowanie danych bez zwiększania kosztów. Co powinni zrobić?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Utwórz plik manifestu, który zawiera lokalizacje plików danych. Użyj polecenia COPY, aby załadować dane do Amazon Redshift..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to utworzenie pliku manifestu. Polecenie COPY w Amazon Redshift może przyjmować plik manifestu, który zawiera listę wielu ścieżek do plików S3, umożliwiając ładowanie wielu plików z różnych lokalizacji S3 w jednej operacji. To znacznie przyspiesza ingestowanie danych, ponieważ Redshift może równolegle przetwarzać wszystkie pliki wymienione w manifeście, eliminując potrzebę wielu oddzielnych poleceń COPY i nie zwiększając kosztów. Użycie Amazon EMR lub zadania AWS Glue do skopiowania plików do jednego folderu przed załadowaniem zwiększyłoby koszty i złożoność, a także dodałoby dodatkowy krok, co nie przyspieszyłoby procesu. Ładowanie danych do Amazon Aurora, a następnie do Redshift, również wprowadza niepotrzebne pośrednictwo i zwiększa koszty.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana