Вам необходимо выполнить разведочный анализ данных (EDA) для набора данных петабайтного масштаба, не управляя инфраструктурой кластера, оплачивая только выполняемые запросы и записывая анализ на Python из Jupyter Notebook. Какое решение удовлетворяет этим ограничениям?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Запустить Apache Spark из Amazon Athena..
Почему это правильный ответ
Правильный ответ — запустить Apache Spark из Amazon Athena. Athena позволяет выполнять интерактивные запросы к данным в S3 без управления серверами, оплачивая только выполненные запросы. Недавняя интеграция с Spark в Athena позволяет использовать Spark для более сложных аналитических задач и машинного обучения, сохраняя при этом бессерверную модель и возможность работы из Jupyter Notebook. Запуск Apache Spark из Amazon SageMaker не является оптимальным, так как SageMaker Studio Notebooks могут подключаться к Spark-кластерам, но сам Spark не является встроенной частью SageMaker для выполнения EDA петабайтного масштаба без дополнительной инфраструктуры. Запуск Apache Spark на кластере Amazon EMR требует управления кластером и оплаты за время его работы, что противоречит требованию "не управляя инфраструктурой кластера, оплачивая только выполняемые запросы". Использование Apache Spark, интегрированного с Amazon Redshift, также не подходит, поскольку Redshift — это хранилище данных, требующее управления и оплаты за выделенные ресурсы, а не бессерверное решение для EDA петабайтного масштаба.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется