Masz dane z czujników gleby IoT w tabeli Amazon DynamoDB o rozmiarze 10 GB oraz dane o zdarzeniach pogodowych w postaci plików JSON o rozmiarze 5 GB w Amazon S3. Chcesz przygotować ten połączony zbiór danych do trenowania modelu Amazon SageMaker z jak najmniejszym narzutem administracyjnym. Które podejście najlepiej realizuje wymaganą transformację?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uruchom crawlery AWS Glue w celu skatalogowania danych. Utwórz zadanie AWS Glue ETL, które łączy zbiory danych DynamoDB i S3 i zapisuje połączone dane wyjściowe jako pliki CSV do Amazon S3..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to uruchomienie crawlerów AWS Glue w celu skatalogowania danych, utworzenie zadania AWS Glue ETL, które łączy zbiory danych DynamoDB i S3, i zapisanie połączonych danych wyjściowych jako plików CSV do Amazon S3. AWS Glue to bezserwerowa usługa ETL, która minimalizuje narzut administracyjny. Crawlery Glue automatycznie wykrywają schemat danych, a zadania Glue ETL mogą łatwo łączyć dane z różnych źródeł, takich jak DynamoDB i S3, a następnie zapisywać je w formacie odpowiednim do trenowania modelu SageMaker (np. CSV) w S3. Uruchomienie klastra Amazon EMR wiąże się z większym narzutem administracyjnym niż AWS Glue. Zapisywanie połączonych danych do Amazon Redshift jest niepotrzebne, ponieważ SageMaker może trenować bezpośrednio z danych w S3. Włączenie DynamoDB Streams i użycie AWS Lambda do dołączania danych do istniejących plików w S3 jest skomplikowane i nieefektywne do łączenia dużych, historycznych zbiorów danych.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana