Firma codziennie wyodrębnia około 1 TB danych ze źródeł takich jak SAP HANA, SQL Server, MongoDB, Kafka i DynamoDB. Niektóre źródła mają niezdefiniowane lub ewoluujące schematy. Rozwiązanie musi wykrywać schematy, wykonywać ETL i ładować dane do S3 w ciągu 15 minut od ich utworzenia. Które podejście zapewnia wymaganą funkcjonalność przy najmniejszym nakładzie operacyjnym?
Wybierz odpowiedź
Dotknij opcji, aby sprawdzić swoją odpowiedź.
Poprawna odpowiedź: Użyj AWS Glue do wykrywania schematu oraz do wyodrębniania, transformacji i ładowania danych do zasobnika S3. Utwórz potok w Apache Spark..
Dlaczego to jest odpowiedź
AWS Glue to w pełni zarządzana usługa ETL, która natywnie integruje się z różnymi źródłami danych, w tym z wymienionymi w pytaniu, i doskonale radzi sobie z wykrywaniem schematów dla danych o niezdefiniowanych lub ewoluujących schematach. Użycie Apache Spark w AWS Glue zapewnia skalowalność i wydajność wymaganą do przetwarzania 1 TB danych w ciągu 15 minut. Minimalizuje to nakład operacyjny, ponieważ AWS Glue zarządza infrastrukturą. Amazon EMR wymaga ręcznego zarządzania klastrami, co zwiększa nakład operacyjny w porównaniu do AWS Glue. AWS Lambda ma ograniczenia czasowe i pamięciowe, co czyni ją nieodpowiednią do przetwarzania 1 TB danych. Amazon Redshift jest hurtownią danych i nie jest przeznaczony do wykrywania schematów ani do bezpośredniego ładowania danych do S3 w sposób opisany w pytaniu.
Zdaj egzamin — bez niekończącego się szukania odpowiedzi
Uzyskaj wszystkie zweryfikowane pytania i wyjaśnienia do tego egzaminu w jednym miejscu i zaoszczędź godziny przygotowań. Ponad 1000 certyfikacji · Ponad 20 języków · Zacznij za darmo.
Zdaj egzamin szybciej → Karta nie jest wymagana