Розничная компания ежедневно загружает CSV-файлы заказов в один путь S3 и использует Amazon Redshift Spectrum для запроса подмножеств данных, содержащих более 100 столбцов. Сторонняя система генерирует более 30 CSV-файлов в день (каждый размером 50–70 МБ). Пользователи агрегируют ежедневные метрики, но производительность запросов снизилась. Какая комбинация действий решит проблемы с производительностью с наименьшими усилиями по разработке? (Выберите два.)
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Настроить стороннее приложение для создания файлов в столбчатом формате., Разделить данные заказов в корзине S3 по дате заказа..
Почему это правильный ответ
Настройка стороннего приложения для создания файлов в столбчатом формате (например, Parquet или ORC) значительно улучшит производительность Redshift Spectrum. Столбчатые форматы позволяют Redshift Spectrum считывать только необходимые столбцы, уменьшая объем сканируемых данных и, следовательно, затраты и время выполнения запросов, особенно для таблиц с большим количеством столбцов. Разделение данных заказов в корзине S3 по дате заказа (партиционирование) также критически важно. Это позволяет Redshift Spectrum сканировать только те подмножества данных, которые соответствуют условиям фильтрации по дате, вместо сканирования всего набора данных. Объединение CSV-файлов в один файл в день не решает проблему неэффективного формата и не предоставляет преимуществ партиционирования. Использование JSON не является столбчатым форматом и не принесет тех же преимуществ в производительности, что и Parquet/ORC, а загрузка JSON в столбец SUPER в Redshift не относится к Redshift Spectrum.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется