Инженер по данным извлекает ежемесячные обучающие данные из Amazon Redshift в Amazon S3. Исходная схема включает TransactionTimestamp (timestamp), CardName (varchar) и CardNo (varchar). Инженер должен (1) удалить строки с CardNo = NULL, (2) разделить TransactionTimestamp на TransactionDate и TransactionTime и (3) переименовать CardName в NameOnCard. Решение должно минимизировать настройку инфраструктуры, быть автоматизированным ежемесячно и создавать минимальную нагрузку на кластер Redshift. Какое решение соответствует этим требованиям?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать задание AWS Glue, которое использует кластер Amazon Redshift в качестве источника и бакет S3 в качестве цели. Использовать встроенные преобразования Glue (Filter, Map, RenameField) для применения необходимых изменений и планировать выполнение задания ежемесячно..
Почему это правильный ответ
AWS Glue — это бессерверный сервис ETL, который идеально подходит для этой задачи. Он позволяет напрямую подключаться к Amazon Redshift, выполнять необходимые преобразования данных (фильтрация строк с CardNo = NULL, разделение TransactionTimestamp и переименование CardName) с помощью встроенных функций и записывать результат в Amazon S3. Glue минимизирует настройку инфраструктуры, так как является бессерверным, и может быть запланирован для ежемесячного выполнения. Он также эффективно обрабатывает данные, снижая нагрузку на Redshift. Использование Amazon EMR требует настройки и управления кластером. Запуск запросов с EC2 вручную или с помощью скриптов не является полностью автоматизированным и масштабируемым решением. Redshift Spectrum предназначен для запросов данных в S3, а не для экспорта и преобразования данных из Redshift в S3 с последующей записью.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется