Amazon DEA-C01: Оптимизация затрат для рабочих нагрузок с данными — Руководство по подготовке

Часть Amazon Data Engineer Associate DEA-C01 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Оптимизация затрат для рабочих нагрузок с данными гарантирует, что хранилища, вычислительные ресурсы и конвейеры обработки данных приносят пользу без неконтролируемого роста расходов. Инженеры данных должны находить баланс между производительностью запросов, долговечностью и доступностью данных с одной стороны, и моделями ценообразования, которые варьируются в зависимости от сервиса и характера использования, с другой. Эта область требует знания классов хранения и политик жизненного цикла, элементов управления на уровне запросов и кластеров, спотовых и зарезервированных мощностей, а также компромиссов между бессерверными и выделенными ресурсами.

Оптимизация затрат на хранение в S3

S3 Intelligent-Tiering — это рекомендуемый по умолчанию вариант для наборов данных с непредсказуемыми шаблонами доступа: включайте Intelligent-Tiering через консоль или AWS CLI, когда частоту доступа к объектам невозможно надежно спрогнозировать. Настраивайте Intelligent-Tiering, учитывая плату за мониторинг/автоматизацию (взимается небольшая ежемесячная плата за мониторинг каждого объекта) и выбирая правильное минимальное количество дней для автоматических переходов между уровнями (30 дней для перехода с уровня частого доступа на уровень нечастого). Используйте теги объектов и правила жизненного цикла, чтобы исключить небольшие, часто запрашиваемые объекты, для которых плата за мониторинг превысит экономию.

Используйте следующие операционные подходы для сокращения расходов на S3:

undefined

), чтобы выявить шаблоны доступа на уровне префиксов/тегов перед созданием правил жизненного цикла.

Критерии принятия решений:

Управление затратами в Athena и Redshift

Стоимость Athena зависит от объема сканированных байт. Применяйте элементы управления рабочими группами (в консоли или через

undefined

), чтобы внедрить лимиты на объем сканируемых данных для одного запроса и месячные бюджеты для каждой рабочей группы; включите опцию “Enforce workgroup settings”, чтобы запросы, превышающие лимит данных на запрос, завершались с ошибкой, а не выполнялись. Сокращайте объем сканируемых байт, преобразуя исходные файлы в колоночные сжатые форматы (Parquet/ORC), выполняя партиционирование по дате или часто используемым для фильтрации столбцам, применяя проталкивание предикатов (predicate pushdown) и используя CTAS или CREATE TABLE AS для материализации оптимизированных наборов данных. Используйте повторное использование результатов запросов и изоляцию рабочих нагрузок в отдельные рабочие группы, чтобы избежать перетекания затрат между командами.

Решения о затратах на Redshift зависят от предсказуемости рабочей нагрузки и выбора хранилища. Для стабильного, предсказуемого использования вычислительных ресурсов хранилища данных приобретайте зарезервированные узлы (Reserved Nodes) (на один или три года, с частичной/полной предоплатой), чтобы зафиксировать скидки по сравнению с тарифами по требованию. Для переменных рабочих нагрузок:

Ключевые моменты для сравнения:

Стратегии управления затратами в Glue и EMR

AWS Glue предоставляет бессерверный ETL с несколькими рычагами управления затратами. Для пакетных заданий, не чувствительных к задержкам, используйте гибкое выполнение Glue (задания Glue Flex), что может сократить затраты до ~34% по сравнению со стандартным выполнением Glue. Настраивайте параметры заданий Glue в Glue Studio или через CLI (

undefined

), чтобы выбрать тип воркера и максимальное количество DPU, установите разумный верхний предел DPU для предотвращения неограниченного автомасштабирования и используйте закладки заданий (job bookmarks), чтобы избежать полной повторной обработки. Для интерактивных или чувствительных к задержкам рабочих нагрузок выбирайте типы воркеров (Standard/G.1X/G.2X) и ответственно настраивайте параллелизм.

Сокращение затрат на EMR основано на использовании спотовых инстансов (Spot Instances) для узлов задач (task nodes), в то время как главный узел (master node) и основные узлы (core nodes) работают в режиме On-Demand (настройте парки инстансов (instance fleets) или группы инстансов (instance groups) в консоли или через

undefined

). Используйте Spot только для узлов задач, выберите стратегию распределения, оптимизированную по емкости, и установите соответствующую ставку/максимальную цену, если используете Spot с торгами. Обеспечьте сохранность состояния кластера и отказоустойчивость заданий следующим образом:

Критерии принятия решений:

Зарезервированные мощности и Savings Plans для сервисов данных

Зарезервированные мощности и Savings Plans применяются к различным сервисам данных по-разному. Для сервисов на базе EC2 (EMR, самостоятельно управляемый HBase, кастомный Hadoop) используйте EC2 Savings Plans или Reserved Instances для покрытия расходов на вычисления; выбирайте региональные или зональные опции в зависимости от требований к мобильности. Redshift поддерживает покупку зарезервированных узлов для подготовленных кластеров, чтобы снизить почасовые затраты для предсказуемых нагрузок хранилища данных. Бессерверные сервисы (Glue, Athena) не имеют резервирования ресурсов; вместо этого оптимизируйте их через планирование рабочих нагрузок и изменение форматов данных.

Практические рекомендации по покупке:

Распространенные ошибки и критерии принятия решений

undefined

) и выберите подходящие типы воркеров, чтобы затраты оставались предсказуемыми.

Практическая задача: снижение затрат на ночные ETL-процессы в Acme Analytics

Компания Acme Analytics выполняет ночные ETL-процессы и ежедневную ad-hoc аналитику; ежемесячные расходы на облако резко выросли из-за роста объема необработанных данных в S3 и часов работы Redshift по требованию (On-Demand). Компании необходимо сократить расходы на 35% без влияния на SLA ночных процессов.

  1. Выполнить анализ классов хранения S3 (Storage Class Analysis) и настроить правила жизненного цикла для перемещения «холодных» необработанных файлов старше 90 дней в Glacier Flexible Retrieval (планировать массовые/стандартные извлечения).
  2. Преобразовать необработанные CSV-файлы в партиционированный и сжатый формат Parquet и объединить мелкие файлы; хранить оптимизированные наборы данных с отдельными префиксами для Athena/Redshift Spectrum.
  3. Создать рабочие группы (workgroups) Athena с лимитами на объем сканируемых данных для каждого запроса и принудительно применять настройки рабочих групп; включить повторное использование результатов запросов и установить ежемесячный бюджет для каждой рабочей группы.
  4. Перенести пакетные ETL-задачи на задания Glue Flex для несрочных преобразований, установить максимальное количество DPU и запланировать их выполнение на часы с низкой нагрузкой; сохранить небольшой парк стандартных ресурсов Glue для срочных заданий.
  5. Оптимизировать размер кластера Redshift: приобрести годовые зарезервированные узлы (Reserved Nodes) для постоянной базовой вычислительной нагрузки, переместить исторические данные в S3 и использовать Spectrum для редко выполняемых запросов, а также включать масштабирование параллелизма (concurrency scaling) только под контролем мониторинга.

Обоснование: Стратегия сочетает оптимизацию формата данных и жизненного цикла (снижая затраты на хранение и сканирование), использование более дешевых бессерверных вычислений для гибких задач (Glue Flex), управление запросами (рабочие группы Athena) и резервирование мощностей для постоянных вычислительных нагрузок, чтобы максимизировать скидки, сохраняя при этом доступность и производительность.


Мониторинг и устранение неполадок конвейеров данных · Все домены · Качество

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт