Dane klientów są codziennie przechowywane w skompresowanych plikach, podzielonych na partycje według daty, w S3. Analitycy co miesiąc pobierają, walidują i przesyłają wyniki do QuickSight. Inżynier musi automatycznie sprawdzać jakość danych przed wysłaniem ich do QuickSight, minimalizując nakład pracy operacyjnej. Które rozwiązanie pasuje najlepiej?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Uruchamiaj AWS Glue crawler co miesiąc, aby zaktualizować AWS Glue Data Catalog. Użyj reguł AWS Glue Data Quality do sprawdzenia jakości danych..
Dlaczego to jest odpowiedź
Poprawna odpowiedź minimalizuje nakład pracy operacyjnej, wykorzystując wbudowane funkcje AWS Glue Data Quality (DQ). AWS Glue crawler automatycznie wykrywa schemat i partycje danych w S3, aktualizując AWS Glue Data Catalog. Reguły AWS Glue DQ pozwalają na zdefiniowanie i automatyczne egzekwowanie zasad jakości danych bez pisania niestandardowego kodu. Pozostałe opcje są mniej optymalne: Użycie zadania AWS Glue z PySpark wymaga pisania i utrzymywania niestandardowego kodu do walidacji danych, co zwiększa nakład pracy operacyjnej. Funkcja AWS Lambda z Pythonem również wymaga niestandardowego kodu i nie jest najlepiej przystosowana do przetwarzania dużych ilości danych w S3 w sposób partycjonowany. Wyzwalanie jej przy dodawaniu obiektów nie pasuje do miesięcznego harmonogramu walidacji. Amazon SQS i CloudWatch Insights nie są przeznaczone do oceny jakości danych na poziomie zawartości plików, a raczej do monitorowania zdarzeń i logów.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana