Amazon DOP-C02: Мониторинг, логирование и наблюдаемость — Руководство по подготовке

Часть AWS DevOps Engineer Professional DOP-C02 — Руководство по подготовке. Практикуйтесь с проверенными ответами в центре экзаменов Amazon, или пройдите тесты на время на ExamRoll.io.

Обзор

Мониторинг, ведение журналов и наблюдаемость в AWS требуют объединения метрик, журналов, трассировок, событий и телеметрии о состоянии в полезные сигналы, на которые можно реагировать. Эффективные архитектуры используют Amazon CloudWatch для метрик, сигналов тревоги и панелей управления; CloudWatch Logs и Logs Insights для приёма и анализа журналов; AWS X-Ray для распределённой трассировки; AWS CloudTrail для аудита и обеспечения целостности; Amazon EventBridge для обнаружения и автоматизации на основе событий; AWS Health для событий сервисов, специфичных для аккаунта; и централизованные конвейеры (Kinesis Data Firehose и OpenSearch) для поиска и корреляции в больших масштабах. Приведённые ниже шаблоны подчёркивают важность снижения шума, точной маршрутизации сигналов, автоматизации и операций в нескольких аккаунтах и регионах.

Метрики, сигналы тревоги, панели управления и составные сигналы тревоги CloudWatch

Метрики CloudWatch являются основой для SLO, масштабирования и оповещений. Публикуйте пользовательские метрики с гранулярными измерениями для изоляции сигналов (например, apiOperation, appVersion, statusCode). Используйте формат CloudWatch Embedded Metric Format (EMF) со структурированными журналами для эффективной отправки измерений с высокой кардинальностью из Lambda, контейнеров и EC2, избегая накладных расходов API PutMetricData.

Настраивайте сигналы тревоги с надёжной оценкой:

Составные сигналы тревоги снижают усталость от оповещений, объединяя несколько базовых сигналов с помощью логики AND/OR. Например, отправлять оповещение только тогда, когда задержка p95 высока, И частота ошибок 5xx превышает порог, И сохраняется насыщение ЦП, тем самым соответствуя влиянию на пользователя. Составные сигналы тревоги принимают обновления состояния от дочерних сигналов тревоги из разных регионов/аккаунтов через меж-аккаунтную наблюдаемость или потоки метрик в центральный аккаунт.

Панели управления (дашборды) визуализируют ключевые показатели по всем сервисам. Используйте виджеты для метрик, результатов запросов Logs Insights и статусов сигналов тревоги. Стандартизируйте соглашения для панелей управления (именование, временные диапазоны, наложение SLO) и используйте межрегиональные/меж-аккаунтные представления с помощью CloudWatch Observability Access Manager (OAM). Для специальной корреляции закрепляйте виджеты Logs Insights и X-Ray ServiceLens рядом с виджетами карты сервисов и показателями ошибок Kinesis Firehose.

CloudWatch Logs: группы журналов, фильтры метрик, фильтры подписки и Logs Insights

Структурируйте группы журналов по приложениям/компонентам и этапам жизненного цикла. Устанавливайте явные политики хранения (не полагайтесь на «Никогда не истекает») и включайте шифрование KMS, где это необходимо. Используйте политики ресурсов и гранулярные IAM-разрешения для контроля производителей и подписчиков. Для высокопроизводительного приёма данных обеспечьте достаточный параллелизм потоков журналов и пакетирование.

Фильтры метрик преобразуют шаблоны журналов в метрики. Определите шаблон фильтра с извлечёнными токенами (в формате JSON или с разделителями-пробелами) и сопоставьте токены с измерениями метрик. Это поддерживает такие сценарии использования, как метрики для каждого API, каждой версии, каждого кода ответа, публикуемые непосредственно из журналов без изменения производителей. Убедитесь, что единицы измерения и значения по умолчанию верны; предпочитайте значение 1 на событие и вычисляйте частоту с помощью метрической математики. Используйте эти метрики для оповещений SLO и панелей управления.

Фильтры подписки передают журналы в потоковом режиме почти в реальном времени в:

CloudWatch Logs Insights предоставляет интерактивные бессерверные запросы к журналам. Основные операторы включают fields, filter, parse, stats, sort, limit, dedup и bin для группировки по времени. Разбирайте поля JSON или используйте разбор в стиле grok для текстовых журналов. Примеры:

AWS X-Ray: трассировка, правила выборки, карты сервисов и аннотации

X-Ray собирает распределенные трассировки между сервисами для выявления источников задержек и границ сбоев. Инструментируйте сервисы с помощью AWS Distro for OpenTelemetry (ADOT) или X-Ray SDK, распространяйте заголовок трассировки (например, X-Amzn-Trace-Id) и запускайте демон/агент X-Ray там, где это необходимо (ECS/EKS/EC2). Многие управляемые сервисы имеют встроенную интеграцию (API Gateway, ALB через проксирование трассировок в логах доступа, Lambda с активной трассировкой, Step Functions через подсегменты).

Правила выборки (sampling rules) контролируют объем данных и точность сигнала. Используйте централизованный набор правил выборки, включающий:

Карты сервисов (service maps) визуализируют граф вызовов, показывая связи с указанием задержек, частоты ошибок и индикаторов троттлинга. Углубляйтесь в трассировки для изучения сегментов и подсегментов для анализа нижестоящих зависимостей. Используйте аннотации (индексируемые пары “ключ-значение”) для фильтрации по данным с высокой кардинальностью, таким как customerTier, apiOperation, appVersion или идентификаторы запросов AWS. Используйте метаданные для подробного, неиндексируемого контекста, чтобы избежать разрастания индекса. Объединяйте группы трассировок X-Ray с CloudWatch ServiceLens для корреляции логов, метрик и трассировок в едином представлении. Создавайте выражения фильтрации (например, annotation.appVersion = "2.3.1" and fault = true), чтобы изолировать регрессии и экспортировать ID трассировок для целевого поиска в логах.

Управление и события: CloudTrail, EventBridge и AWS Health

CloudTrail записывает активность API для управления и криминалистического анализа. Включите организационный trail для всех аккаунтов и всех регионов с доставкой в централизованный бакет S3 с шифрованием SSE-KMS, включите проверку целостности файлов логов и интегрируйте с CloudWatch Logs для обнаружения событий почти в реальном времени. Различайте классы событий:

EventBridge предоставляет фабрику событий для обнаружения и автоматизации. Используйте шину событий по умолчанию для событий сервисов AWS и создавайте пользовательские шины для событий домена приложения. Определяйте шаблоны событий (event patterns), соответствующие полям source, detail-type, detail, префиксам, числовым диапазонам и условию “anything-but” (все, кроме). Применяйте преобразователи ввода (input transformers) для изменения структуры событий, прикрепляйте политики на основе ресурсов для публикации между аккаунтами и настраивайте повторные попытки/очередь недоставленных сообщений (DLQ) для получателей. Типичные получатели включают Lambda (исправление), Step Functions (оркестрация), SQS (разделение компонентов), Systems Manager Automation (операционные действия), CodePipeline (триггеры CI) и SNS (уведомления). Архивируйте и воспроизводите события для восстановления после сбоев потребителей и используйте реестр схем для генерации строго типизированных моделей событий.

AWS Health предоставляет информацию о событиях сервисов, запланированных изменениях и операционных проблемах, специфичных для вашего аккаунта. Интегрируйте через EventBridge с source aws.health и detail-type AWS Health Event, чтобы направлять события в каналы для инцидентов, открывать OpsItems в OpsCenter или запускать безопасное завершение работы или масштабирование на время окон обслуживания. Используйте Organizational View с делегированным аккаунтом администратора для агрегации событий Health по всем аккаунтам и рассмотрите возможность использования AWS Health API или решения AWS Health Aware для отправки отобранных уведомлений в системы дежурных инженеров.

Централизованный сбор логов с помощью Kinesis Data Firehose и OpenSearch

Стратегия сбора логов в среде с несколькими аккаунтами и регионами (multi-account, multi-Region) стандартизирует их приём и поиск. В каждом аккаунте-источнике (producer account) настройте фильтры подписки (subscription filters) CloudWatch Logs на межсетевой приемник логов (cross-account Logs destination), который использует централизованный поток Kinesis Data Firehose. Включите следующие функции Firehose:

Совместите этот конвейер с фильтрами метрик (metric filters) CloudWatch для быстрых и недорогих счётчиков и с Logs Insights для глубокого анализа логов по запросу (ad hoc). Используйте правила EventBridge, срабатывающие на аномалии в Firehose/OpenSearch или на сигналы тревоги CloudWatch, чтобы запускать процессы исправления (remediations) или создавать инциденты.

Практический сценарий проблемы

Airbnb сталкивается с периодическими всплесками ошибок и задержек API в микросервисах, развёрнутых на EKS и Lambda, при этом используется несколько версий мобильного приложения. Операционной команде требуется обнаружение проблем почти в реальном времени с разбивкой по операции API, коду ответа и версии приложения; быстрый анализ первопричин (root cause analysis) по трассировкам и логам; автоматическое исправление известных шаблонов сбоев; и аудиторские журналы, соответствующие требованиям управления (governance).

  1. Стандартизируйте структурированное логирование
  1. Создайте фильтры метрик в CloudWatch Logs
  1. Постройте многоуровневые и составной сигналы тревоги в CloudWatch
  1. Разверните трассировку X-Ray с целевой выборкой
  1. Коррелируйте данные с помощью ServiceLens и Logs Insights

undefined

).

  1. Централизуйте логи через Firehose в OpenSearch и S3
  1. Автоматизируйте обнаружение и исправление с помощью EventBridge
  1. Интегрируйте AWS Health и обработку технического обслуживания
  1. Усильте управление с помощью организационного трейла CloudTrail и проверки целостности
  1. Уведомления и интеграция с Ops

Эта архитектура была выбрана, чтобы объединить метрики с низкой задержкой и богатыми измерениями (CloudWatch + EMF), глубокую корреляцию трассировок (X-Ray + ServiceLens), масштабируемый поиск (OpenSearch + S3/Athena), исправление на основе событий (EventBridge + Lambda/SSM/Step Functions) и аудируемое управление (CloudTrail с проверкой целостности). Она балансирует стоимость и точность данных за счёт выборки, уровней хранения и целевых сигналов тревоги, которые отражают реальное влияние на пользователей.


Инфраструктура как код и управление конфигурациями · Все домены · Безопасность

Отработать эти вопросы → · Тесты на время на ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Сдайте экзамен →

Просмотреть Amazon →

Related guides

Все включено

Одна подписка. Каждый экзамен.

Каждый план открывает неограниченный поиск ответов, практические тесты, объяснения AI и полную библиотеку ресурсов — на более чем 20 языках.

Ежемесячно
24.87
Just €0.83/day
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

Лучшая цена
12 месяцев
179.87
Just €0.49/daySave 40%
Все включено:
  • Неограниченный поиск ответов
  • Неограниченные практические тесты
  • Объяснения на основе AI
  • Полная библиотека ресурсов
  • 20+ языков
  • Еженедельные обновления контента
  • Награды и рефералы
  • Приоритетная поддержка
Начать бесплатную пробную версию

Кредитная карта не требуется*

✓ Включен бесплатный план · ✓ Отмена в любое время · ✓ Все планы открывают полный продукт