AdView Inc. хочет создать единый поток SageMaker Data Wrangler, который объединяет CSV-файл журналов кампаний из S3 с таблицей профилей клиентов Redshift, а затем экспортирует очищенный, объединенный набор данных в Parquet. Кластер Redshift находится в частной подсети. Какова правильная последовательность действий для реализации этого в Data Wrangler, обеспечивая при этом связность и корректность?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Загрузите CSV-файл S3 как набор данных Data Wrangler и добавьте Redshift как другой набор данных в поток, используя учетные данные Redshift JDBC. Добавьте преобразование Join в поток, указав ключи объединения. Настройте обработку/экспорт потока Data Wrangler для запуска в VPC с подсетями и группами безопасности, которые разрешают доступ к кластеру Redshift, и убедитесь, что роль IAM, используемая Data Wrangler, имеет разрешение на доступ к S3 и учетным данным Redshift..
Почему это правильный ответ
Правильный ответ описывает полный и корректный процесс использования Data Wrangler для объединения данных из S3 и Redshift. Он включает загрузку обоих источников данных, применение преобразования Join и, что критически важно, настройку Data Wrangler для работы в VPC с соответствующими подсетями и группами безопасности, чтобы обеспечить доступ к частному кластеру Redshift. Также упоминается необходимость правильных разрешений IAM для доступа к S3 и Redshift. Неправильные варианты: Второй вариант ошибочен, поскольку Data Wrangler не создает автоматически прокси-сервер базы данных Redshift и требует настройки VPC для доступа к частным ресурсам. Третий вариант предлагает обходное решение с использованием AWS Glue, что не соответствует требованию использования единого потока Data Wrangler. Data Wrangler может получать доступ к Redshift. Четвертый вариант некорректен, поскольку Data Wrangler не будет автоматически передавать объединение в Redshift без соответствующей сетевой настройки и учетных данных. Использование Glue crawler для S3 и федеративного запроса Redshift также не соответствует требованию единого потока Data Wrangler.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется