Компания ежедневно извлекает около 1 ТБ данных из таких источников, как SAP HANA, SQL Server, MongoDB, Kafka и DynamoDB. Некоторые источники имеют неопределенные или изменяющиеся схемы. Решение должно обнаруживать схемы, выполнять ETL и загружать данные в S3 в течение 15 минут после создания данных. Какой подход обеспечивает требуемую функциональность с наименьшими эксплуатационными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать AWS Glue для обнаружения схемы, а также для извлечения, преобразования и загрузки данных в бакет S3. Создать конвейер в Apache Spark..
Почему это правильный ответ
AWS Glue — это бессерверный сервис ETL, который идеально подходит для обнаружения схем в данных с неопределенными или изменяющимися схемами (полуструктурированные и неструктурированные данные) с помощью своих краулеров. Он может извлекать данные из различных источников, включая SAP HANA, SQL Server, MongoDB, Kafka и DynamoDB, выполнять преобразования с использованием Apache Spark и загружать их в S3. Бессерверная природа Glue минимизирует эксплуатационные издержки, поскольку вам не нужно управлять серверами. 15-минутное окно обработки достижимо с помощью Spark-заданий в Glue. Использование Amazon EMR требует управления кластерами, что увеличивает эксплуатационные издержки по сравнению с бессерверным Glue. AWS Lambda не подходит для обработки 1 ТБ данных из-за ограничений по времени выполнения и памяти. Amazon Redshift — это хранилище данных, а не инструмент для обнаружения схем или ETL из множества разнородных источников, и его использование для этой цели неэффективно.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется