Firma potrzebuje potoku danych bliskiego rzeczywistemu dla dużych wolumenów danych clickstream z e-commerce: pozyskiwanie, przetwarzanie i wizualizacja. Rozwiązanie musi obsługiwać przetwarzanie oparte na SQL i Jupyter Notebooks do pracy interaktywnej. Która architektura spełnia te wymagania?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj Amazon MSK do pozyskiwania, Amazon Managed Service for Apache Flink do przetwarzania i użyj wbudowanego pulpitu nawigacyjnego Flink do wizualizacji..
Dlaczego to jest odpowiedź
Prawidłowa odpowiedź to użycie Amazon MSK do pozyskiwania, Amazon Managed Service for Apache Flink do przetwarzania i wbudowanego pulpitu nawigacyjnego Flink do wizualizacji. MSK (Managed Streaming for Apache Kafka) jest idealne do pozyskiwania dużych wolumenów danych clickstream w czasie zbliżonym do rzeczywistego. Apache Flink, zarządzany przez AWS, doskonale nadaje się do przetwarzania strumieniowego w czasie rzeczywistym i obsługuje interaktywne przetwarzanie oparte na SQL (za pomocą Flink SQL) oraz Jupyter Notebooks. Wbudowane pulpity nawigacyjne Flink umożliwiają wizualizację wyników. Pozostałe opcje są mniej odpowiednie: Kinesis Data Firehose jest usługą dostarczania, a nie przetwarzania interaktywnego. Lambda nie jest optymalna do złożonego przetwarzania strumieniowego. Kinesis Data Streams jest dobrym wyborem do pozyskiwania, ale Athena służy do zapytań ad-hoc na danych w S3, a nie do ciągłego przetwarzania strumieniowego. AWS Glue z PySpark może przetwarzać strumienie, ale Flink jest bardziej wyspecjalizowany w przetwarzaniu w czasie rzeczywistym i oferuje lepszą integrację z SQL/Jupyter dla strumieni.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana