Компания ежедневно запускает ETL-конвейер, реализованный в виде скриптов Python на большом инстансе EC2, для очистки, преобразования, обогащения и сжатия терабайтов данных о взаимодействии пользователей, хранящихся в S3. Процесс занимает более 20 часов, и компания хочет перейти с EC2 на управляемое бессерверное решение с минимальными усилиями по разработке. Какой подход соответствует этим требованиям?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать задание AWS Glue, преобразовать скрипты в PySpark, запустить задание Glue для обработки данных и сохранить результаты в S3..
Почему это правильный ответ
AWS Glue — это бессерверный сервис ETL, который хорошо подходит для обработки больших объемов данных, хранящихся в S3, и поддерживает PySpark, что позволяет легко перенести существующие Python-скрипты с минимальными изменениями. Это соответствует требованиям к управляемому бессерверному решению и минимизации усилий по разработке. Redshift не предназначен для ETL-процессов такого масштаба и требует загрузки данных, что не является бессерверным подходом. DynamoDB не подходит для хранения и обработки терабайтов данных взаимодействия пользователей. Использование отдельных функций Lambda с Step Functions для обработки терабайтов данных может быть сложным и дорогим, так как Lambda имеет ограничения по времени выполнения и объему памяти, что затрудняет обработку больших файлов.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется