Amazon DOP-C02: Systems Manager, Patching e Automação Operacional — Guia de estudos
Faz parte do AWS DevOps Engineer Professional DOP-C02 — Guia de estudos. Pratique com respostas verificadas no centro de exames da Amazon, ou faça testes cronometrados no ExamRoll.io.
Visão Geral
A automação operacional na AWS depende do AWS Systems Manager, que unifica o controle de acesso, a configuração, a aplicação de patches e a remediação em instâncias EC2, servidores on-premises e na borda (edge). Serviços complementares fornecem pipelines de “golden images” (EC2 Image Builder), governança de licenças (AWS License Manager), otimização contínua (AWS Trusted Advisor e AWS Compute Optimizer) e controles de custos (Savings Plans). O objetivo é ter operações padronizadas e auditáveis que sejam orientadas a eventos e aplicáveis entre contas e Regiões.
Acesso, Parâmetros, Inventário e Conformidade do Systems Manager
O Systems Manager Session Manager fornece acesso shell interativo e auditável a instâncias gerenciadas sem abrir portas de entrada ou gerenciar chaves SSH. Você se conecta pelo “control plane” da AWS, opcionalmente através de endpoints de interface da VPC para conectividade privada. O encaminhamento de porta (port forwarding) permite o acesso seguro a serviços locais ou remotos por trás da instância:
- Sessões de encaminhamento de porta local roteiam uma porta da estação de trabalho local para uma porta na instância de destino (por exemplo, encaminhar localhost:8080 para instance:8080).
- O encaminhamento de porta de host remoto roteia uma porta local através da instância para outro host privado alcançável a partir dessa instância. O Session Manager suporta log de auditoria centralizado das transcrições e I/O da sessão tanto para o Amazon S3 quanto para o Amazon CloudWatch Logs, com criptografia KMS opcional. A atividade da API (StartSession, TerminateSession) é capturada no AWS CloudTrail. Imponha controles através das preferências do Session Manager: exija criptografia, restrinja o encaminhamento de porta ou a área de transferência e registre logs em ambos os destinos.
O Systems Manager Parameter Store centraliza configurações e segredos (secrets). Use parâmetros SecureString criptografados com uma chave KMS gerenciada pelo cliente para os segredos da aplicação. Organize os valores em caminhos hierárquicos (por exemplo, /prod/payments/db/password) para permitir o escopo por ambiente e aplicação, o escopo de políticas e operações em massa. O versionamento de parâmetros mantém um histórico imutável; rótulos (como “current”) permitem que você aponte aplicações para um alvo móvel sem alterar o código. Referências dinâmicas no CloudFormation, CodeBuild e outros serviços resolvem os parâmetros no momento da implantação ou execução, evitando a proliferação de segredos. O nível (tier) Standard oferece throughput básico e tamanho máximo de valor de 4 KB; o nível Advanced suporta políticas de parâmetros (expiração, notificações de rotação), valores maiores (8 KB) e throughput mais alto. Regras do EventBridge podem notificar sobre alterações de parâmetros, e políticas de recursos permitem o compartilhamento de parâmetros entre contas quando necessário.
O Systems Manager Inventory e o Compliance fornecem visibilidade no nível da frota (fleet). O Inventory (habilitado através de uma associação do State Manager) coleta metadados como pacotes de software instalados, funções do Windows, adaptadores de rede e itens de inventário personalizados. Use o Resource Data Sync para exportar para o S3 para análise com Athena/Glue e para exibir o status de toda a frota no Systems Manager Explorer. O Compliance agrega os estados de patching e de associação: você pode ver quais instâncias estão com patches ausentes ou falharam nas linhas de base (baselines) de configuração. Isso cria a base de dados operacionais necessária para remediação automatizada, auditorias e descoberta de licenças.
Patch Manager e Orquestração Operacional
O Patch Manager padroniza a aplicação de patches de SO e de aplicações usando “patch baselines”, “patch groups” e janelas de manutenção (maintenance windows).
As “patch baselines” definem o que aprovar e quando. Para cada família de SO, você pode começar com um padrão fornecido pela AWS ou construir uma “baseline” personalizada com:
- Regras de aprovação automática por produto/versão, classificação (por exemplo, Security, Bugfix), severidade e arquitetura
- Um atraso na aprovação (por exemplo, aprovar automaticamente patches de segurança sete dias após o lançamento)
- Listas de permissão (allow lists) e de bloqueio (block lists) explícitas
- Fontes/repositórios de patches (por exemplo, adicionar um repositório yum ou apt personalizado para software interno)
Associe uma “baseline” a um “patch group”. Um “patch group” é um conjunto de instâncias identificadas pela tag
Patch Groupcom um valor específico (por exemplo, Patch Group=linux-prod); a associação garante que a “baseline” correta seja direcionada aos servidores certos. Cada instância deve pertencer a um único “patch group” para evitar ambiguidade. As operações de patch usam o documentoAWS-RunPatchBaselinecomOperation=Scanpara calcular a conformidade eOperation=Installpara aplicar os patches aprovados. Controle a simultaneidade (concurrency), os limites de erro (error thresholds) e o comportamento de reinicialização. Use oInstallOverrideListpara fixar pacotes específicos em caso de emergência. Os resultados de conformidade fluem para o Systems Manager Compliance, onde você pode alertar e remediar.
As janelas de manutenção (maintenance windows) restringem operações disruptivas a períodos seguros. Defina uma programação (rate/cron), duração e um tempo de corte (cutoff) para impedir que novas tarefas comecem perto do final da janela. Registre alvos (targets) por tags ou grupos de recursos e, em seguida, registre tarefas (tasks) com prioridade. O Patch Manager se integra nativamente: registre uma tarefa AWS-RunPatchBaseline para seus “patch groups” e “baselines”. As configurações de simultaneidade e limite de erro nas tarefas evitam um “blast radius” (raio de explosão) durante falhas.
O Systems Manager Automation operacionaliza a remediação repetível e auditável. Use “runbooks” integrados e personalizados para orquestrar atividades pré e pós-patch (por exemplo, drenar do load balancer, parar os serviços da aplicação, aplicar o patch, executar testes básicos (smoke tests), registrar novamente) e para impor controles através da remediação do AWS Config. O Automation suporta aprovações (Change Manager), calendários de mudança (para evitar a execução durante períodos de “blackout”) e execução entre contas/Regiões via “assume-role”. Conecte tudo com regras do Amazon EventBridge que reagem a eventos de saúde, desvios de configuração (config drift) ou alarmes para acionar execuções de Automation direcionadas para autorrecuperação (self-healing).
Imagens Golden com o EC2 Image Builder
Imagens imutáveis reduzem o drift e encurtam as janelas de patch. O EC2 Image Builder codifica a criação e distribuição de AMIs usando pipelines, receitas (recipes) e configurações de distribuição.
- As receitas de imagem (Image recipes) especificam a imagem base (por exemplo, a versão mais recente do Amazon Linux 2023), os componentes (etapas de compilação/teste definidas em YAML, como a instalação do SSM Agent, runtimes de linguagem e reforço de segurança), e o versionamento semântico. Os componentes podem ser reutilizados em várias receitas para impor controles de linha de base.
- Os pipelines definem o fluxo de trabalho de ponta a ponta: configuração de infraestrutura (VPC/sub-redes/instance profile/security groups), etapas de compilação, etapas de teste e agendamento (por exemplo, semanalmente). O Image Builder aplica patches de SO automaticamente no momento da compilação, executa testes e reprova as compilações que não são aprovadas.
- As configurações de distribuição replicam e compartilham imagens: publicar AMIs em Regiões selecionadas, adicionar permissões de execução (launch permissions) para contas ou OUs do AWS Organizations, impor a criptografia de EBS (com uma chave KMS) e marcar as saídas com tags. O Image Builder pode publicar o ARN da AMI mais recente no Systems Manager Parameter Store (por exemplo, /prod/images/web/latest) para que os grupos do Auto Scaling, o CodePipeline e o CloudFormation consumam a imagem atual aprovada sem atualizações manuais.
Essa abordagem de pipeline funciona em conjunto com o Patch Manager: aplique patches na AMI com frequência para minimizar os deltas de patch da instância e, em seguida, use janelas de manutenção para patches delta menores em servidores de longa duração.
Governança, Licenciamento e Otimização de Custos
O AWS License Manager governa o uso de licenças próprias (bring-your-own-license - BYOL) e os entitlements do Marketplace. Defina configurações de licença que modelam as regras do fornecedor (cores, soquetes, vCPUs, afinidade de host e restrições de virtualização), escolha a imposição rígida (hard) ou flexível (soft) e associe as configurações a AMIs, launch templates ou instâncias. O License Manager descobre softwares via Systems Manager Inventory para rastrear o consumo e prevenir lançamentos não conformes. Para produtos do Marketplace que usam entitlements do License Manager, você pode compartilhar concessões entre contas e rastrear o uso de entitlements centralmente com um administrador delegado.
O AWS Trusted Advisor avalia continuamente seu ambiente em relação às melhores práticas. As categorias incluem otimização de custos, segurança, tolerância a falhas, limites de serviço, performance e excelência operacional. Com o Suporte Business ou Enterprise, você pode acessar o conjunto completo de verificações e a API do AWS Support para atualizar e recuperar resultados programaticamente. Use a integração com o EventBridge para rotear mudanças de status das verificações para fluxos de trabalho de remediação (por exemplo, acionar um runbook do Automation para habilitar a criptografia padrão do S3 ou remover o acesso público em um bucket) e habilite a Organizational View para agregar dados entre contas com acesso IAM de escopo definido e notificações para as equipes certas.
A otimização de custos é contínua e orientada por dados:
- Right-sizing: Combine as recomendações de right-sizing do Cost Explorer com os insights do AWS Compute Optimizer. O Compute Optimizer analisa métricas de instâncias, grupos de Auto Scaling, volumes EBS, funções Lambda e ECS no Fargate para recomendar configurações ideais com economia projetada e risco de performance. Ele também pode sinalizar volumes gp2 que devem migrar para gp3 com throughput/IOPS ajustados. Combine as recomendações com janelas de manutenção e runbooks do Automation para executar mudanças seguras.
- Savings Plans: Use Compute Savings Plans para uma cobertura ampla em EC2, Fargate e Lambda, ou EC2 Instance Savings Plans para os maiores descontos em famílias/Regiões específicas. Comprometa-se com um valor de $/hora por um ou três anos com opções de pagamento (Sem/Parcial/Total Adiantado), agregue entre contas via faturamento consolidado e dimensione os compromissos usando o gasto histórico On-Demand. Monitore a utilização e a cobertura e ajuste conforme as cargas de trabalho evoluem. Continue usando Reserved Instances para serviços não cobertos pelos Savings Plans (por exemplo, RDS, OpenSearch, Redshift, DynamoDB).
- Habilitadores operacionais: Use o Systems Manager Automation e o Change Manager para agendar paradas/inícios (stop/start) de ambientes de não produção, impor agendamentos de instâncias e implementar transições de right-sizing e de gp2→gp3 com aprovações e guardrails. Reforce com as verificações de custo do Trusted Advisor e orçamentos/alertas.
Cenário de Problema Prático
Empresa: Airbnb
Desafio: O Airbnb opera cargas de trabalho EC2 multi-account e multi-Region para processamento de dados e serviços web. A segurança exige acesso auditável e sem SSH; a conformidade exige a aplicação de patches de segurança em tempo hábil de repositórios padrão e personalizados; o time de plataforma deve padronizar AMIs e reduzir custos sem risco de performance. Fornecedores de software impõem licenciamento baseado em cores para certos nós de análise. A equipe de operações deseja remediação orientada a eventos e visibilidade executiva entre as contas.
Abordagem passo a passo:
- Impor acesso seguro com o Systems Manager Session Manager
- Configure endpoints da VPC para SSM/EC2Messages e habilite o logging do Session Manager para o CloudWatch Logs e S3 com criptografia KMS. Desabilite o SSH e exija o Session Manager para acesso shell. Habilite o encaminhamento de porta (port forwarding) para permitir que os engenheiros acessem serviços internos com segurança durante a solução de problemas.
- Por quê: Remove a superfície de ataque de entrada, centraliza as trilhas de auditoria e permite o encaminhamento de porta controlado sem VPN ou bastions.
- Padronizar a configuração e a visibilidade com o Inventory e o Compliance
- Crie uma associação do State Manager para habilitar o Inventory em todas as instâncias. Configure o Resource Data Sync para o S3 e consulte com o Athena. Habilite o Compliance para o status de patches e associações e exiba a saúde da frota (fleet) no Systems Manager Explorer.
- Por quê: O Inventory permite uma visão precisa da postura de software/patches e alimenta a descoberta de licenças e auditorias downstream.
- Definir baselines de patch e grupos de patch com repositórios personalizados
- Crie baselines de patch personalizadas no Patch Manager por sistema operacional que aprovam automaticamente atualizações de segurança após sete dias e adicione repositórios yum/apt personalizados para agentes internos. Marque as instâncias com as tags Patch Group=linux-web, linux-data e windows-app. Associe as baselines a cada grupo de patch.
- Por quê: Garante que tanto os pacotes padrão quanto os personalizados sejam corrigidos de forma consistente com aprovações em estágios em diversas cargas de trabalho.
- Agendar a aplicação de patches via Maintenance Windows com etapas de pré/pós-execução do Automation
- Para cada grupo de patch, registre uma janela de manutenção alinhada com o horário não comercial. Registre uma tarefa de alta prioridade do Automation que drena instâncias dos target groups, executa o AWS-RunPatchBaseline (Install) com limites de concorrência e erro controlados, reinicia se necessário, executa smoke tests e registra novamente no load balancer.
- Por quê: Minimiza o impacto no cliente, impõe uma orquestração segura e gera um histórico de execução auditável.
- Construir golden images com o EC2 Image Builder e publicar no Parameter Store
- Crie receitas (recipes) que incluam o SSM Agent, componentes de hardening de segurança e pré-requisitos de aplicação. Os pipelines constroem semanalmente, executam testes e publicam AMIs para us-east-1 e eu-west-1, compartilhando com contas selecionadas via Organizations. Salve os ARNs das AMIs mais recentes em /prod/images/web/latest e /prod/images/data/latest no Parameter Store.
- Por quê: Reduz o desvio de configuração (drift) e o tempo para aplicar patches em instâncias; desenvolvedores e pipelines de implantação obtêm imagens aprovadas (blessed images) via parâmetros, sem distribuição manual de IDs.
- Governar licenças de fornecedores com o AWS License Manager
- Defina configurações de licença para software de análise usando contagem de vCPU com imposição rígida (hard enforcement). Associe-as às AMIs e launch templates correspondentes. Habilite o administrador delegado para rastrear o consumo entre contas usando os dados de descoberta do Inventory.
- Por quê: Previne lançamentos não conformes e fornece um uso de licença comprovável para fornecedores e o setor financeiro.
- Implementar remediação e guardrails orientados a eventos
- Use regras gerenciadas do AWS Config (por exemplo, tags obrigatórias, criptografia do S3) com ações de remediação automática que invocam runbooks do Systems Manager Automation. Adicione regras do EventBridge para eventos de manutenção do AWS Health para acionar reinicializações seguras via runbooks.
- Por quê: Fecha o ciclo da detecção à correção sem trabalho manual repetitivo, mantendo os recursos em conformidade com as políticas.
- Otimizar custos com o Compute Optimizer e Savings Plans, governados por controle de mudanças
- Habilite o Compute Optimizer entre as contas; semanalmente, exporte as recomendações de right-sizing e de gp2→gp3. Use aprovações do Change Manager e janelas de manutenção para aplicar mudanças de família de instâncias e modificações de volume EBS. Adquira um Compute Savings Plan combinado (blended) na conta pagadora (payer account) para cobrir a computação em estado estável (steady-state) entre as Regiões; monitore a utilização e ajuste trimestralmente. Use o Systems Manager Automation para impor agendamentos de start/stop em dev/test.
- Por quê: A otimização orientada por dados com implementação controlada (rollout) captura economias enquanto protege a performance e a disponibilidade.
- Monitorar com o Trusted Advisor de forma organizacional
- Habilite a Organizational View do Trusted Advisor e a integração com o EventBridge para notificar as equipes de plataforma e segurança sobre descobertas de alto risco (por exemplo, limites de serviço, recursos ociosos, security groups abertos). Para verificações selecionadas, acione runbooks do Systems Manager Automation para remediar ou abrir tickets.
- Por quê: A supervisão centralizada e a resposta automatizada mantêm a higiene operacional e previnem custos ou riscos descontrolados.
Este design integrado oferece acesso seguro, aplicação de patches padronizada, AMIs imutáveis, conformidade de licenças, remediação automatizada e otimização de custos mensurável, tudo com controles auditáveis em toda a presença do Airbnb na AWS.
← Redes e Entrega de Conteúdo · Todos os domínios
Pratique estas questões → · Prática cronometrada no ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Passe no seu exame →