Amazon SOA-C02: 모니터링, 로깅 및 해결 — 학습 가이드
다음의 일부입니다: AWS SysOps Administrator Associate SOA-C02 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
모니터링, 로깅 및 해결 조치는 AWS 환경의 운영 신경계와 같은 역할을 합니다. 즉, 문제를 감지하고, 컨텍스트를 제공하며, 수정 조치를 이끌어냅니다. 이 도메인은 의미 있는 지표 및 대시보드 생성, 비용 효율적인 로그 수집 및 보존, 추적 가능한 애플리케이션 관측성 구축, 경보 및 해결 조치 자동화를 다룹니다. 잘 구현된 시스템은 신호와 노이즈의 균형을 맞추고, 비용을 제어하며, 플레이북과 자동화가 테스트되고 감사 가능하도록 보장합니다.
CloudWatch 지표, 대시보드 및 경보
비즈니스 및 운영 SLI(지연 시간, 오류율, 대기열 깊이, 인프라의 CPU/메모리)를 중심으로 지표를 설계합니다. 내장 지표(EC2, RDS, ELB)를 사용하고, 애플리케이션 수준 카운터를 위해
undefined
와 같이 PutMetricData를 통한 사용자 지정 지표를 추가합니다. 필터링을 가능하게 하는 차원(InstanceId, ServiceName)을 선호하고, 지표 비용을 폭증시키는 고유성(high-cardinality)이 높은 차원은 피합니다.
CloudWatch 대시보드를 사용하여 지표, 로그, 경보를 운영 뷰로 통합합니다. 콘솔에서 또는 CloudFormation(AWS::CloudWatch::Dashboard)을 통해 위젯을 생성하고, 파생 지표를 위한 지표 수학(metric math)을 사용합니다. 예를 들어, 지표 수학(ERRORS/SUM(REQUESTS))을 사용하여 오류율을 계산하고 백분위수(p50, p90, p99)를 표시합니다. 경보의 경우, 의도에 따라 구성 패턴을 선택합니다:
- 단일 지표 경보: 단순 임계값을 위한 경보입니다.
undefined
- 복합 경보: 여러 경보의 조건을 (AND/OR로) 결합하여 노이즈를 줄입니다.
- 이상 탐지: 임계값을 자동 조정합니다. 예상되는 계절적 동작을 보이는 지표에 CloudWatch 이상 탐지를 사용합니다.
결정 기준: 플래핑(flapping)을 방지하기 위해 평가 기간과 경보 발생에 필요한 데이터 포인트 설정을 사용합니다. 경보 조치로 SNS, Auto Scaling 또는 Systems Manager Automation을 트리거합니다. 가변적인 기준선을 가진 환경에서는 복합 경보와 이상 탐지를 선호합니다.
CloudWatch Logs, Logs Insights 및 보존
CloudWatch Logs 그룹으로 로그를 집계하고 애플리케이션 및 환경별로 구조화합니다. CLI를 통해 로그 그룹을 생성합니다:
undefined
. 그리고
undefined
명령어로 보존 기간을 설정합니다. 구독 필터를 사용하여 로그를 Kinesis Data Firehose(S3/Redshift용), Lambda(실시간 처리) 또는 파트너 도구로 스트리밍합니다. S3에서 압축 및 파티셔닝하여 스토리지 비용을 절감합니다.
임시 쿼리 및 대시보드를 위해 CloudWatch Logs Insights를 사용합니다. 추적 ID와 오류 컨텍스트를 추출하는 저장된 쿼리를 구축합니다(예:
undefined
). 보존 및 수집 비용 제어 방법:
- 규정 준수 및 문제 해결 요구 사항에 따라 로그 그룹별로 적절한 보존 기간(7/30/90/365일)을 설정합니다.
- 보존 수명 주기 또는 Firehose를 통해 오래된 로그를 S3로 내보내고, 압축 및 수명 주기 규칙을 사용하여 Glacier/Archive로 이동시킵니다.
- 샘플링 또는 구조화된 로그(JSON) 및 EMF(Embedded Metric Format)를 사용하여 비용이 많이 드는 고유성이 높은 로그를 줄이면서도 지표를 파생시킵니다.
결정 기준: 상세한 디버그 로그는 짧은 보존 기간을, 감사/보안 로그는 긴 보존 기간을 설정합니다. 대용량 로그는 CloudWatch에 무기한 보존하는 대신 S3로 라우팅합니다.
CloudTrail, 감사 추적 및 이벤트 기록
모든 리전과 계정에서 CloudTrail을 활성화하고, 중앙 집중식 감사 로깅을 위해 조직 추적(organization trail)을 생성하여 보안된 S3 버킷에 저장하며, 로그 파일 무결성 검증 및 SSE-KMS 암호화를 사용합니다. 관리 이벤트(읽기/쓰기)를 구성하고, 데이터 이벤트는 더 많은 양과 비용을 유발하므로 상세한 감사가 필요한 경우에만 선택적으로 데이터 이벤트(S3 객체 수준, Lambda 함수 호출)를 활성화합니다.
콘솔의 CloudTrail 이벤트 기록은 90일간의 빠른 검색에 사용하고, 장기 분석 및 조사를 위해서는 S3로 내보낸 로그에 대해 CloudTrail Lake나 Athena를 사용합니다. 다음과 같은 방법으로 추적을 보호합니다:
- 다중 리전 추적을 적용하여 글로벌 서비스 이벤트를 캡처합니다.
- 거의 실시간 탐지를 위해 CloudTrail을 CloudWatch Logs와 통합하거나, 특정 이벤트를 Lambda/Systems Manager로 라우팅하여 자동화된 해결 조치를 위해 EventBridge와 통합합니다.
- 조작을 방지하기 위해 S3 버킷 정책과 S3 Object Lock(필요한 경우)을 적용합니다.
결정 기준: 포렌식 가시성이 필요한 버킷/함수에 대해서만 데이터 이벤트를 활성화합니다. 규정 준수를 단순화하기 위해 중앙 집중식 추적 및 교차 계정 액세스 패턴을 사용합니다.
애플리케이션 추적 및 관측성 (X-Ray)
AWS X-Ray SDK로 애플리케이션을 계측(instrument)하여 세그먼트와 하위 세그먼트를 내보냅니다. 계측되지 않은 런타임의 경우, X-Ray 데몬/에이전트를 사이드카 또는 서비스(ECS 작업, EC2 데몬 또는 Lambda 내장 추적)로 실행합니다. 샘플링 규칙을 구성하여 추적 볼륨을 제어하고, ServiceLens에서 서비스 맵을 설정하여 서비스 간의 종속성을 시각화합니다. 비즈니스 키(userId, orderId)로 추적에 주석을 달고, 예외/메타데이터를 기록하여 문제 분류(triage)를 돕습니다.
애플리케이션 로그에 X-Ray 추적 ID를 포함하여(추적 헤더 또는 SDK를 사용하여 현재 추적 ID 가져오기) 추적과 로그를 상호 연관시켜 CloudWatch Logs Insights 쿼리가 로그와 추적을 결합할 수 있도록 합니다. Lambda의 경우, 활성 추적(콘솔 또는
undefined
)을 활성화하여 추적을 X-Ray로 자동 전송합니다. 추적 분석을 사용하여 꼬리 지연 시간(tail latency), 핫스팟, 데이터베이스 호출 분석 등을 탐지합니다.
결정 기준: 중요한 서비스에 대해 추적을 활성화하고 적응형 샘플링을 사용하여 비용을 제한합니다. 로그와 추적의 상관관계를 명확하게 만들기 위해 구조화된 추적(주석/메타데이터)을 선호합니다.
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →