Инженер машинного обучения должен объединять и преобразовывать еженедельные данные из двух источников: больших CSV-файлов в S3 (каждый с миллионами строк) и кластера Amazon Aurora. Объединенные выходные данные должны быть записаны в другой бакет S3. Какой вариант обеспечивает это с НАИМЕНЬШИМИ операционными издержками?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Планировать еженедельное задание AWS Glue с использованием движка Apache Spark и использовать операции DynamicFrame для объединения и преобразования данных..
Почему это правильный ответ
AWS Glue — это бессерверный сервис ETL, который идеально подходит для объединения и преобразования данных из различных источников, включая S3 и Aurora. Использование движка Apache Spark и DynamicFrames в AWS Glue позволяет эффективно обрабатывать большие объемы данных с минимальными операционными издержками, поскольку AWS управляет базовой инфраструктурой. Выделение временного кластера Amazon EMR требует ручного управления и настройки, что увеличивает операционные издержки. Запуск кода Apache Spark в AWS Lambda непрактичен для миллионов строк данных из-за ограничений Lambda по времени выполнения и памяти. AWS Batch на инстансах EC2 также требует управления инфраструктурой и масштабированием, что повышает операционные издержки по сравнению с бессерверным AWS Glue.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется