Amazon DOP-C02: Systems Manager, установка исправлений и операционная автоматизация — Руководство по подготовке
Часть AWS DevOps Engineer Professional DOP-C02 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.
Обзор
Автоматизация операционной деятельности в AWS основана на AWS Systems Manager, который объединяет управление доступом, конфигурацией, установкой исправлений и устранением неполадок для EC2, локальных серверов и периферийных устройств. Сопутствующие сервисы предоставляют конвейеры для создания «золотых» образов (EC2 Image Builder), управление лицензиями (AWS License Manager), непрерывную оптимизацию (AWS Trusted Advisor и AWS Compute Optimizer) и контроль затрат (Savings Plans). Цель — стандартизированные, аудируемые операции, управляемые событиями и применимые ко всем аккаунтам и регионам.
Доступ, параметры, инвентаризация и соответствие в Systems Manager
Systems Manager Session Manager предоставляет интерактивный, аудируемый доступ к оболочке управляемых экземпляров без открытия входящих портов и управления SSH-ключами. Вы подключаетесь через плоскость управления AWS, опционально используя интерфейсные эндпоинты VPC для частного подключения. Перенаправление портов обеспечивает безопасный доступ к локальным или удаленным сервисам за экземпляром:
- Сессии с локальным перенаправлением портов направляют трафик с порта локальной рабочей станции на порт целевого экземпляра (например, перенаправляют localhost:8080 на порт 8080 экземпляра).
- Перенаправление портов на удаленный хост направляет трафик с локального порта через экземпляр на другой частный хост, доступный с этого экземпляра. Session Manager поддерживает централизованное ведение аудиторских журналов с записями сессий и их ввода-вывода как в Amazon S3, так и в Amazon CloudWatch Logs, с возможностью шифрования с помощью KMS. Активность API (StartSession, TerminateSession) фиксируется в AWS CloudTrail. Применяйте средства контроля через настройки Session Manager: требуйте шифрование, ограничивайте перенаправление портов или использование буфера обмена и настройте ведение журналов в оба места назначения.
Systems Manager Parameter Store централизует хранение конфигураций и секретов. Используйте параметры типа SecureString, зашифрованные с помощью управляемого клиентом ключа KMS, для хранения секретов приложений. Организуйте значения в иерархические пути (например, /prod/payments/db/password), чтобы обеспечить разграничение по окружениям и приложениям, применение политик и выполнение массовых операций. Версионирование параметров сохраняет неизменяемую историю; метки (например, current) позволяют направлять приложения на изменяемую цель без изменения кода. Динамические ссылки в CloudFormation, CodeBuild и других сервисах разрешают значения параметров во время развертывания или выполнения, предотвращая бесконтрольное распространение секретов. Уровень Standard обеспечивает базовую пропускную способность и максимальный размер значения 4 КБ; уровень Advanced поддерживает политики параметров (истечение срока действия, уведомления о ротации), больший размер значений (8 КБ) и более высокую пропускную способность. Правила EventBridge могут уведомлять об изменениях параметров, а политики ресурсов позволяют при необходимости предоставлять доступ к параметрам другим аккаунтам.
Systems Manager Inventory и Compliance обеспечивают обзор всего парка ресурсов. Inventory (включается через ассоциацию State Manager) собирает метаданные, такие как установленные пакеты ПО, роли Windows, сетевые адаптеры и пользовательские элементы инвентаризации. Используйте Resource Data Sync для экспорта данных в S3 для анализа с помощью Athena/Glue и отображения состояния всего парка в Systems Manager Explorer. Compliance агрегирует состояния установки исправлений и ассоциаций: вы можете видеть, на каких экземплярах отсутствуют исправления или не удалось применить базовые конфигурации. Это создает фундамент операционных данных, необходимый для автоматического исправления, аудитов и обнаружения лицензий.
Patch Manager и оркестрация операций
Patch Manager стандартизирует установку исправлений для ОС и приложений с помощью базовых наборов исправлений (patch baselines), групп исправлений (patch groups) и окон обслуживания (maintenance windows).
Базовые наборы исправлений определяют, что и когда одобрять. Для каждого семейства ОС вы можете начать с набора по умолчанию от AWS или создать собственный базовый набор, указав:
- Правила автоматического одобрения по продукту/версии, классификации (например, Security, Bugfix), серьезности и архитектуре
- Задержку одобрения (например, автоматически одобрять исправления безопасности через семь дней после их выпуска)
- Явные списки разрешенных и заблокированных исправлений
- Источники/репозитории исправлений (например, добавить пользовательский репозиторий yum или apt для внутреннего ПО) Свяжите базовый набор с группой исправлений. Группа исправлений — это набор экземпляров, идентифицируемых по тегу Patch Group с определенным значением (например, Patch Group=linux-prod); эта связь гарантирует, что правильный базовый набор будет применяться к нужным серверам. Каждый экземпляр должен принадлежать только одной группе исправлений во избежание неоднозначности. Операции по установке исправлений используют документ AWS-RunPatchBaseline с параметром Operation=Scan для оценки соответствия и Operation=Install для применения одобренных исправлений. Контролируйте параллелизм, пороги ошибок и поведение при перезагрузке. Используйте InstallOverrideList для экстренной фиксации определенных пакетов. Результаты проверки соответствия поступают в Systems Manager Compliance, где вы можете настроить оповещения и исправления.
Окна обслуживания ограничивают операции, нарушающие работу, безопасными временными рамками. Определите расписание (rate/cron), продолжительность и время прекращения, чтобы остановить запуск новых задач ближе к концу окна. Зарегистрируйте цели по тегам или группам ресурсов, а затем зарегистрируйте задачи с указанием приоритета. Patch Manager интегрируется нативно: зарегистрируйте задачу AWS-RunPatchBaseline для ваших групп и базовых наборов исправлений. Настройки параллелизма и порогов ошибок для задач предотвращают большой радиус поражения при сбоях.
Systems Manager Automation делает возможным повторяемое и аудируемое исправление. Используйте встроенные и пользовательские сценарии (runbooks) для оркестрации действий до и после установки исправлений (например, исключить из балансировщика нагрузки, остановить сервисы приложения, установить исправления, выполнить дымовое тестирование, повторно зарегистрировать), а также для принудительного применения контроля через исправления AWS Config. Automation поддерживает утверждения (Change Manager), календари изменений (для предотвращения выполнения во время периодов заморозки) и выполнение в разных аккаунтах/регионах через assume-role. Свяжите все воедино с помощью правил Amazon EventBridge, которые реагируют на события о состоянии здоровья, отклонения конфигурации или сигналы тревоги, запуская целевые выполнения Automation для самовосстановления.
Управление, лицензирование и оптимизация затрат
AWS License Manager управляет использованием собственных лицензий (BYOL) и правами на использование из Marketplace. Определите конфигурации лицензий, которые моделируют правила поставщиков (ядра, сокеты, vCPU, привязка к хосту и ограничения виртуализации), выберите жёсткое или мягкое применение правил и свяжите конфигурации с AMI, шаблонами запуска или инстансами. License Manager обнаруживает программное обеспечение с помощью Systems Manager Inventory для отслеживания потребления и предотвращения запусков, не соответствующих требованиям. Для продуктов Marketplace, использующих права License Manager, вы можете делиться разрешениями между аккаунтами и централизованно отслеживать использование прав с помощью делегированного администратора.
AWS Trusted Advisor постоянно оценивает вашу среду на соответствие лучшим практикам. Категории включают оптимизацию затрат, безопасность, отказоустойчивость, лимиты сервисов, производительность и операционное совершенство. С планами поддержки Business или Enterprise вы получаете доступ к полному набору проверок и AWS Support API для программного обновления и получения результатов. Используйте интеграцию с EventBridge для направления изменений статуса проверок в рабочие процессы по устранению неполадок (например, для запуска runbook службы Automation, чтобы включить шифрование по умолчанию для S3 или удалить публичный доступ к бакету), и включите Organizational View для агрегации данных по всем аккаунтам с ограниченным доступом IAM и уведомлениями для соответствующих команд.
Оптимизация затрат — это непрерывный и основанный на данных процесс:
- Оптимизация размеров (Right-sizing): Совмещайте рекомендации по оптимизации размеров от Cost Explorer с аналитикой AWS Compute Optimizer. Compute Optimizer анализирует метрики инстансов, групп Auto Scaling, томов EBS, функций Lambda и задач ECS на Fargate, чтобы рекомендовать оптимальные конфигурации с прогнозируемой экономией и рисками для производительности. Он также может отмечать тома gp2, которые следует перевести на gp3 с настроенной пропускной способностью/IOPS. Сочетайте рекомендации с окнами обслуживания и runbook-сценариями Automation для безопасного внесения изменений.
- Savings Plans: Используйте Compute Savings Plans для широкого покрытия EC2, Fargate и Lambda или EC2 Instance Savings Plans для получения самых высоких скидок в определенных семействах/регионах. Возьмите обязательство по расходам в $/час на один или три года с вариантами оплаты (без предоплаты, частичная предоплата, полная предоплата), агрегируйте расходы по аккаунтам через консолидированную оплату и рассчитывайте размер обязательств на основе исторических расходов на инстансы по требованию (On-Demand). Отслеживайте утилизацию и покрытие и корректируйте их по мере развития рабочих нагрузок. Продолжайте использовать Reserved Instances для сервисов, не покрываемых Savings Plans (например, RDS, OpenSearch, Redshift, DynamoDB).
- Операционные инструменты: Используйте Systems Manager Automation и Change Manager для планирования остановки/запуска непроизводственных сред, принудительного применения расписаний для инстансов, а также для внедрения оптимизации размеров и переходов с gp2 на gp3 с утверждениями и защитными механизмами (guardrails). Подкрепляйте это проверками затрат в Trusted Advisor и бюджетами/оповещениями.
Практический сценарий
Компания: Airbnb
Задача: Airbnb использует рабочие нагрузки EC2 в нескольких аккаунтах и регионах для обработки данных и веб-сервисов. Требования безопасности предписывают аудируемый доступ без использования SSH; требования соответствия обязывают своевременно применять патчи безопасности как из стандартных, так и из пользовательских репозиториев; команда платформы должна стандартизировать AMI и сократить затраты без риска для производительности. Поставщики программного обеспечения навязывают лицензирование на основе ядер для определенных аналитических узлов. Операционная команда хочет внедрить устранение неполадок на основе событий и обеспечить наглядное представление для руководства по всем аккаунтам.
Пошаговый подход:
- Обеспечение безопасного доступа с помощью Systems Manager Session Manager
- Настройте VPC endpoints для SSM/EC2Messages и включите логирование Session Manager в CloudWatch Logs и S3 с шифрованием KMS. Отключите SSH и требуйте использования Session Manager для доступа к оболочке. Включите перенаправление портов, чтобы инженеры могли безопасно подключаться к внутренним сервисам во время устранения неполадок.
- Зачем: Устраняет поверхность атаки для входящих соединений, централизует журналы аудита и позволяет контролируемо перенаправлять порты без VPN или бастионных хостов.
- Стандартизация конфигурации и видимости с помощью Inventory и Compliance
- Создайте ассоциацию в State Manager, чтобы включить Inventory на всех инстансах. Настройте Resource Data Sync в S3 и выполняйте запросы с помощью Athena. Включите Compliance для отслеживания статуса патчей и ассоциаций и отображайте состояние парка инстансов в Systems Manager Explorer.
- Зачем: Inventory обеспечивает точное представление о состоянии ПО/патчей и обеспечивает последующее обнаружение лицензий и проведение аудитов.
- Определение базовых наборов патчей (patch baselines) и групп патчей (patch groups) с пользовательскими репозиториями
- Создайте пользовательские Patch Manager baselines для каждой ОС, которые автоматически утверждают обновления безопасности через семь дней, и добавьте пользовательские репозитории yum/apt для внутренних агентов. Пометьте инстансы тегами Patch Group=linux-web, linux-data и windows-app. Свяжите базовые наборы патчей с каждой группой.
- Зачем: Обеспечивает последовательное применение патчей как для стандартных, так и для пользовательских пакетов с поэтапными утверждениями для различных рабочих нагрузок.
- Планирование установки патчей через Maintenance Windows с шагами Automation до/после
- Для каждой группы патчей зарегистрируйте окно обслуживания, соответствующее нерабочим часам. Зарегистрируйте высокоприоритетную задачу Automation, которая выводит инстансы из целевых групп, запускает AWS-RunPatchBaseline (Install) с контролируемым параллелизмом и порогами ошибок, перезагружает инстансы при необходимости, выполняет дымовые тесты и снова регистрирует их в балансировщике нагрузки.
- Зачем: Минимизирует влияние на клиентов, обеспечивает безопасную оркестрацию и предоставляет аудируемую историю выполнения.
- Создание «золотых» образов с помощью EC2 Image Builder и публикация в Parameter Store
- Создайте «рецепты», включающие SSM Agent, компоненты для усиления безопасности и предварительные условия для приложений. Конвейеры еженедельно выполняют сборку, запускают тесты и публикуют AMI в регионах us-east-1 и eu-west-1, предоставляя к ним доступ выбранным аккаунтам через Organizations. Запишите ARN последних AMI в параметры /prod/images/web/latest и /prod/images/data/latest в Parameter Store.
- Зачем: Уменьшает расхождения в конфигурации (drift) и время на установку патчей на инстансах; разработчики и конвейеры развертывания получают утвержденные образы через параметры без ручного распространения ID.
- Управление лицензиями поставщиков с помощью AWS License Manager
- Определите конфигурации лицензий для аналитического ПО с подсчетом по vCPU и жёстким применением правил. Свяжите их с соответствующими AMI и шаблонами запуска. Включите делегированного администратора для отслеживания потребления на основе данных, обнаруженных с помощью Inventory.
- Зачем: Предотвращает запуски, не соответствующие требованиям, и предоставляет доказуемую информацию об использовании лицензий поставщикам и финансовому отделу.
- Внедрение автоматического устранения неполадок на основе событий и защитных механизмов
- Используйте управляемые правила AWS Config (например, обязательные теги, шифрование S3) с автоматическими действиями по устранению, которые вызывают runbook-сценарии Systems Manager Automation. Добавьте правила EventBridge для событий обслуживания AWS Health, чтобы запускать безопасные перезапуски через runbook-сценарии.
- Зачем: Замыкает цикл от обнаружения до исправления без ручного труда, поддерживая ресурсы в соответствии с политиками.
- Оптимизация затрат с помощью Compute Optimizer и Savings Plans под управлением контроля изменений
- Включите Compute Optimizer для всех аккаунтов; еженедельно экспортируйте рекомендации по оптимизации размеров и переходу с gp2 на gp3. Используйте утверждения в Change Manager и окна обслуживания для применения изменений в семействах инстансов и модификаций томов EBS. Приобретите смешанный Compute Savings Plan в платящем аккаунте для покрытия стабильной вычислительной нагрузки в разных регионах; отслеживайте утилизацию и корректируйте ежеквартально. Используйте Session Manager Automation для принудительного применения расписаний запуска/остановки в средах разработки и тестирования.
- Зачем: Оптимизация на основе данных с контролируемым внедрением позволяет экономить средства, сохраняя при этом производительность и доступность.
- Мониторинг с помощью Trusted Advisor на уровне организации
- Включите Trusted Advisor Organizational View и интеграцию с EventBridge для уведомления команд платформы и безопасности о высокорисковых находках (например, лимиты сервисов, простаивающие ресурсы, открытые группы безопасности). Для выбранных проверок настройте запуск runbook-сценариев Systems Manager Automation для устранения проблем или создания заявок.
- Зачем: Централизованный надзор и автоматическое реагирование поддерживают операционную гигиену и предотвращают неконтролируемый рост затрат или рисков.
Этот интегрированный подход обеспечивает безопасный доступ, стандартизированное применение патчей, неизменяемые AMI, соответствие лицензионным требованиям, автоматизированное устранение неполадок и измеримую оптимизацию затрат — все это с аудируемыми механизмами контроля в масштабе всей инфраструктуры Airbnb на AWS.
← Сетевое взаимодействие и доставка контента · Все домены
Отработать эти вопросы → · Тесты на время на ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Сдайте экзамен →