Компания загружает CSV-файлы в бакет Amazon S3. AWS Glue crawler создает таблицы и схемы для данных, а задание AWS Glue обрабатывает таблицы и записывает результаты в базу данных Amazon Redshift. Задание Glue обрабатывает сопоставление столбцов и при необходимости создает таблицы Redshift. Повторный запуск задания Glue приводит к появлению дублирующихся строк в таблицах Redshift. Компании нужен способ обновить таблицы Redshift без появления дубликатов. Какой подход удовлетворяет этому требованию?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Изменить задание AWS Glue, чтобы скопировать строки во временную таблицу Redshift. Добавить команды SQL для обновления существующих строк новыми значениями из временной таблицы Redshift..
Почему это правильный ответ
Правильный подход заключается в использовании временной таблицы в Amazon Redshift для обработки обновлений. Загрузка новых данных во временную таблицу позволяет выполнить операцию UPSERT (UPDATE или INSERT) с помощью SQL-команд, таких как MERGE или комбинации DELETE и INSERT, чтобы обновить существующие строки и вставить новые, избегая дубликатов. Остальные варианты не подходят: Загрузка данных в MySQL и последующее копирование в Redshift добавляет ненужную сложность и задержки, а также не является идиоматическим решением для Redshift. dropDuplicates() в Spark DataFrame удалит дубликаты из текущего набора данных, но не решит проблему обновления уже существующих строк в Redshift, что приведет к потере старых данных или некорректным обновлениям. ResolveChoice в AWS Glue используется для разрешения неоднозначностей типов данных в схеме, а не для обработки дубликатов или обновления записей.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется