Компания будет создавать несколько моделей ML-прогнозирования. Обучающие данные хранятся в Amazon S3, а полный набор данных превышает 5 ТБ и содержит файлы CSV, JSON, Parquet и текстовые файлы. Данные должны пройти несколько последовательных этапов обработки, которые включают сложные преобразования и некоторую работу с NLP, что может занять часы. Весь процесс должен быть автоматизирован. Какое решение соответствует этим требованиям?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Создать рабочий процесс Amazon SageMaker Pipelines для этапов обработки и запускать/автоматизировать конвейер с помощью Amazon EventBridge..
Почему это правильный ответ
Amazon SageMaker Pipelines — это специализированный инструмент для создания, управления и автоматизации рабочих процессов ML, что идеально подходит для сложных многоэтапных преобразований данных и NLP, особенно с большими наборами данных (более 5 ТБ). Интеграция с EventBridge позволяет автоматизировать запуск конвейера по расписанию или по событиям. Использование SageMaker Data Wrangler для каждого этапа обработки неэффективно для автоматизации сложных последовательных преобразований и NLP. Ноутбуки SageMaker подходят для интерактивной разработки, но не для автоматизированных производственных конвейеров. Функции AWS Lambda имеют ограничения по времени выполнения и памяти, что делает их непригодными для обработки данных объемом более 5 ТБ и длительных задач NLP.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется