Microsoft AZ-305: 모니터링, 비용 최적화 및 운영 — 학습 가이드
다음의 일부입니다: Microsoft Azure Solutions Architect Expert AZ-305 — 학습 가이드. 검증된 답안으로 연습하기: Microsoft 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
개요
견고한 Azure 모니터링 및 운영 설계는 단일 텔레메트리 패브릭, 실행 가능한 경고, 관리되는 비용, 전사적 규정 준수 보고 체계를 구축합니다. 이 솔루션은 Azure Monitor의 메트릭과 로그, Log Analytics와 Kusto Query Language(KQL), 애플리케이션 텔레메트리를 위한 Application Insights, 그리고 Azure Policy, Azure Resource Graph, Advisor를 통한 운영 거버넌스를 포괄합니다. 비용 관리는 Azure Cost Management를 통해 강화되며, 플랫폼 안정성과 변경 사항 인지는 Azure Service Health에 의존합니다. Azure Automation은 반복 가능한 문제 해결 및 업데이트 오케스트레이션을 통해 전체 프로세스를 완성합니다. Workbooks는 이러한 서비스 전반의 인사이트를 통합하여 운영 가시성을 제공합니다.
Azure Monitor, Application Insights, Workbooks를 사용한 관찰 가능성
Azure Monitor는 플랫폼과 워크로드 전반에서 텔레메트리를 수집하여 시계열 메트릭과 로그 데이터를 저장합니다. 메트릭은 임계값 및 SLO 추적(예: CPU, HTTP 5xx 비율)에 적합한 경량의 거의 실시간 값입니다. 로그는 상관관계 분석과 근본 원인 분석을 지원하는 구조화되고 쿼리 가능한 텔레메트리를 캡처합니다. 빠른 증상 감지를 위해 메트릭 경고를 설계하고, KQL을 사용하여 더 풍부한 조건 기반 탐지를 위해 로그 경고를 설계하십시오.
작업 그룹은 탐지와 대응을 분리합니다. 이메일/SMS/음성, 푸시 알림, 보안 웹훅, ITSM 커넥터, Azure Functions, Logic Apps, Automation runbook을 연결할 수 있습니다. 프로덕션 환경과 비프로덕션 환경에 대해 별도의 작업 그룹을 사용하고, 계획된 유지 관리 중에는 억제 일정을 적용하십시오. 일관된 페이로드를 사용하여 경고를 인시던트 관리로 라우팅하고, 리소스 컨텍스트와 runbook 링크를 포함시키십시오.
완벽한 가시성을 확보하려면 진단 설정이 필수적입니다. 리소스, 리소스 그룹, 구독 범위에서 진단 설정을 활성화하여 메트릭과 리소스 로그(예: Activity, Administrative, Policy, Security, NetworkSecurityGroupFlowEvent)를 쿼리를 위해 Log Analytics로, 콜드 보존을 위해 스토리지로, SIEM으로 스트리밍하기 위해 Event Hubs로 내보내십시오. 배포 및 정책 평가에 대해 보고하고 월간 변경 보고서를 작성할 수 있도록 항상 Activity Log에 구독 수준 진단 설정을 구성하십시오.
Application Insights는 심층적인 애플리케이션 관찰 가능성을 추가합니다. SDK 또는 OpenTelemetry로 계측하여 분산 추적, 종속성, 요청, 예외, 사용자 지정 이벤트를 수집하십시오. 지원되는 경우 Azure Monitor 에이전트를 통해 App Services, Functions, AKS, VM/VMSS에서 자동 계측을 사용하여 코드 변경을 최소화하십시오. 가용성 테스트는 여러 지역에서 사용자 트래픽을 시뮬레이션합니다. 빈도, 테스트 위치, SSL/HTTP 검사, 성공 기준을 구성하십시오. Smart Detection은 내장된 분석 기능을 사용하여 갑작스러운 실패 급증 및 성능 저하와 같은 이상 패턴을 식별합니다. 샘플링은 통계적 정확성을 유지하면서 수집량과 비용을 제어합니다. 동적 트래픽에는 적응 샘플링을, 결정론적 분석에는 고정 비율 샘플링을 적용하고, 규정 준수를 위해 전체 캡처가 필요한 중요한 트랜잭션은 샘플링에서 제외하십시오.
Azure Monitor Workbooks는 메트릭, 로그, 비용 신호를 단일 아티팩트로 통합하는 대화형 매개변수화된 대시보드를 제공합니다. 구독, 지역, 환경, 시간 범위에 대한 매개변수를 사용하여 여러 랜딩 존에서 재사용성을 높이십시오. 시각화와 설명 텍스트를 결합하여 운영 플레이북과 페이지 내 실행 설명서를 표준화하십시오. Workbook을 리소스 그룹에 저장하고, 제어된 액세스를 위해 RBAC를 적용하며, 코드형 인프라(IaC) 배포를 위해 JSON을 템플릿화하십시오.
대규모 Log Analytics 및 KQL 활용
Log Analytics 작업 영역은 Azure Monitor Logs의 중앙 집계 지점입니다. 데이터 상주 요구 사항에 따라 지역별 중앙 집중식 작업 영역을 선택하거나, 엄격한 데이터 주권 또는 RBAC 분리가 필요한 경우 랜딩 존당 하나씩의 연합 설계를 선택하십시오. 대기업의 경우, 민감하거나 대용량 도메인을 위해 허브(공유 작업 영역)와 선택적 스포크 작업 영역을 사용하는 방식을 선호하십시오. 데이터 가치에 맞춰 테이블 플랜을 조정하십시오. 가치가 높은 보안 및 운영 데이터에는 Analytics 테이블을, 검색 전용 액세스가 가능한 상세하지만 가치가 낮은 로그에는 Basic Logs를, 장기 저비용 보존 및 Search Jobs를 통한 검색에는 Archive를 사용하십시오.
데이터 수집 규칙(DCR)은 Azure Monitor Agent(AMA)가 수집할 항목(syslog/이벤트 로그, 성능 카운터, Windows 이벤트 채널, 사용자 지정 텍스트 로그 포함)을 정의합니다. OS 유형 및 역할별로 별개의 DCR을 사용하고, 하이브리드 환경을 위해 VMSS, 스케일셋, Azure Arc를 통해 범위를 관리하십시오. 거버넌스와 일관성을 위해 레거시 수집 API보다 DCR 기반 사용자 지정 테이블을 선호하십시오.
보존 기간은 조사 기간과 비용 사이의 균형을 맞춰야 합니다. 일상적인 운영에 사용되는 핫 데이터(예: 30-90일)에는 테이블별 보존 기간을 적용하고, 규정 준수 및 위협 헌팅을 위해 롱테일 데이터(예: 6-24개월)는 보관하십시오. 수집량, 노이즈가 가장 많은 상위 테이블을 모니터링하고, DCR에서 샘플링 또는 필터링을 적용하여 중복 로그 수집을 방지하십시오. 수집량이 예측 가능할 경우 약정 계층을 사용하여 수집 비용을 최적화하십시오.
KQL은 운영의 공용어입니다. 필터(where), 변환(extend, project), 시간 비닝(bin/1m), 집계(summarize by), 조인(inner/leftouter), 렌더링(render timechart)을 마스터하십시오. 제한 제어가 있는 로그 경고를 위한 예약된 쿼리, 고유 카디널리티 경고를 위한 분할 기준 차원, 기준선 기반 경고를 위한 동적 임계값을 구축하십시오. 구체화된 뷰와 쿼리 성능 튜닝(예: 사용하지 않는 열을 조기에 project-away, 시간 창 좁히기)은 비용 효율적인 쿼리를 보장합니다. ARM 배포 보고를 위해, AzureActivity 또는 Log Analytics로 내보낸 Azure Resource Graph 변경 기록을 쿼리하고, 거버넌스 분석을 위해 Policy 이벤트와 상호 연관시키십시오.
비용, 상태, Advisor, Resource Graph 및 정책 규정 준수
Azure Cost Management은 사전 예방적 거버넌스를 가능하게 합니다. 구독, 리소스 그룹 또는 관리 그룹 범위로 지정된 예산은 누적 임계값(예: 50%, 80%, 100%)에 도달하면 경고를 트리거합니다. 예산 경고를 작업 그룹에 연결하여 중요하지 않은 리소스에 태그를 지정하거나, 규모를 축소하거나, 격리하는 Logic Apps 또는 Functions를 실행할 수 있습니다. 비용 분석을 사용하여 분할 상환 보기를 구축하고, 태그(비용 센터, 소유자)별로 그룹화하고, 서비스 또는 지역별로 이상 징후를 식별할 수 있습니다. 예약 및 Savings Plan 권장 사항은 VM, SQL, Cosmos DB 등에 대한 약정 구매 기회를 제시합니다. 구매 범위(단일 구독 또는 공유), 기간(1년 또는 3년), 적용 범위 일치(인스턴스 크기 유연성, Azure Hybrid Benefit)를 평가합니다.
Azure Advisor는 구독과 리소스를 지속적으로 평가하여 비용(규모 최적화, 유휴 리소스, 예약), 보안(Defender for Cloud를 통해), 안정성(영역 중복성, 백업/복원 상태), 성능(크기 조정, SKU 가이드), 운영 우수성(태그 관리, 정책 채택)에 걸쳐 우선순위가 지정된 권장 사항을 생성합니다. Advisor Score를 추적하여 현재 상태를 정량화하고 엔지니어링 백로그를 관리합니다.
Azure Service Health는 플랫폼 인식 수준을 운영에 반영합니다. 서비스 문제는 실시간 인시던트를 포착하고, 계획된 유지 관리는 예정된 플랫폼 변경 사항을 전달하며, 상태 권고에는 사용 중단 및 모범 사례가 포함됩니다. 구독, 지역, 서비스별로 필터링하여 작업 그룹으로 서비스 상태 경고를 구성합니다. Service Health를 Resource Health와 함께 사용하여 플랫폼 오류와 워크로드 문제를 구분하고 정확한 인시던트 분류를 수행합니다.
Azure Resource Graph는 KQL과 유사한 구문을 사용하여 대기 시간이 짧은 대규모 쿼리로 테넌트 전체의 인벤토리 및 규정 준수 분석을 제공합니다. 수천 개의 구독에 걸쳐 쿼리하여 리소스 드리프트, 태그 없는 자산, 안전하지 않은 구성 또는 지원되지 않는 SKU를 열거합니다. Resource Graph 결과를 정책 규정 준수 리소스와 조인하여 예외 및 마지막 평가 시간을 포함한 관리 그룹 롤업을 생성합니다. 변경 내용 추적(사용 가능한 경우)을 사용하여 포렌식 분석을 위한 속성 델타를 캡처합니다.
Azure Policy는 가드레일을 적용하고 규정 준수를 측정합니다. 관리 그룹, 구독 또는 리소스 그룹 범위에서 정책 및 이니셔티브를 할당합니다. 규정 준수 상태(규정 준수, 비준수, 충돌, 오류, 예외)를 이해합니다. 규정 준수 메트릭을 왜곡하지 않고 위험 수용을 모델링하기 위해 근거와 만료 날짜가 있는 예외를 사용하고, 필요한 최소 범위만 제외합니다. deployIfNotExists 및 modify 효과의 경우, 최소 권한 원칙에 따른 관리 ID를 사용하여 수정 작업을 구성합니다. 규정 준수 대시보드와 Activity Log에서 수정 작업 상태, 실패, 작업을 모니터링하고, 지속적인 비준수 상태에 대한 경고를 설정합니다. 정책 평가를 Resource Graph 및 Workbooks와 결합하여 경영진 수준의 거버넌스 대시보드를 표시합니다.
자동화 및 패치 관리
Azure Automation은 반복 가능한 작업을 오케스트레이션합니다. PowerShell 또는 Python으로 Runbook을 작성하고, 일정, 웹훅, 이벤트 기반 트리거 또는 경고를 통해 트리거합니다. Hybrid Runbook Workers를 사용하여 프라이빗 네트워크나 다른 클라우드의 리소스 가까이에서 자동화를 실행하며, 이는 Azure Arc의 관리를 받습니다. 표준화된 모듈과 오류 처리를 구현하고, 비밀은 Key Vault에 저장합니다.
Update Management는 OS의 최신 상태를 보장합니다. 조직은 Azure Automation Update Management(레거시) 또는 Azure Update Manager를 사용하여 평가, 승인, 유지 관리 기간 및 동적 그룹을 통해 대규모 패치 오케스트레이션을 수행할 수 있습니다. 경고를 통합하여 배포 실패를 감지하고 구독, OS, 심각도별로 규정 준수 보고서를 생성합니다. 구성 드리프트(configuration drift)의 경우, Azure Automation State Configuration(DSC)을 사용하여 선언적 구성을 적용하고, 규정 준수를 추적하며, 편차를 수정합니다. 구성을 코드로 모델링하고, 버전을 관리하며, 환경별로 스테이징합니다.
경고를 통합하여 자동 복구 시나리오를 위한 Runbook을 트리거합니다. 예를 들어 CPU 포화 시 스케일 아웃, 하트비트 손실 시 실패한 서비스 재시작, 또는 Policy에 의해 감지된 비준수 리소스 격리 등이 있습니다. ITSM 커넥터를 통해 인시던트를 생성하여 루프를 완성하고, Runbook에 내장된 Log Analytics 쿼리를 통해 복구 전후의 증거를 포함합니다.
실제 문제 시나리오
Tailwind Traders는 6개의 구독에 걸쳐 AKS, App Service, Azure SQL Database 기반의 다중 지역(multi-region) 이커머스 플랫폼을 운영하고 있습니다. 경영진은 99.9%의 서비스 가용성, 월간 배포 변경 보고, 약정을 통한 20% 비용 절감, 태그 및 네트워크 정책에 대한 감사 가능한 규정 준수를 요구합니다.
- 중앙 집중식 원격 측정 설정
- 데이터 상주(data residency) 및 RBAC 요구 사항을 충족하기 위해 두 개의 Log Analytics 작업 영역(미국, 유럽)을 생성합니다. 구독, 리소스 그룹 및 모든 중요 리소스에 대한 진단 설정을 구성하여 메트릭/리소스 로그와 활동 로그(Activity Log)를 지역별 작업 영역으로 보냅니다. 이 방식을 선택한 이유는 지역별 이중 작업 영역 모델이 국경 간 데이터 이동 없이 주권, 성능, 중앙 집중식 분석의 균형을 맞추기 때문입니다.
- 애플리케이션 계측
- 지원되는 경우 App Service 및 AKS 사이드카에 대해 자동 계측(autoinstrumentation)으로 Application Insights를 활성화하고, Go로 작성된 서비스에는 OpenTelemetry를 사용합니다. 적응 샘플링(adaptive sampling)과 분산 추적(distributed tracing)을 구성합니다. 이 방식을 선택한 이유는 최소한의 코드 변경과 통제된 수집 비용으로 요청, 종속성, 예외에 대한 깊은 가시성을 확보하기 위함입니다.
- 실행 가능한 경고 설정
- SLO 증상(p95 지연 시간, 5xx 비율, 큐 깊이)에 대한 메트릭 경고와 오류 폭증 및 사용자 지정 KQL 탐지에 대한 로그 경고를 구현합니다. 역할 기반 작업 그룹으로 라우팅합니다: Ops On-Call(PagerDuty + 이메일), SRE Automation(Logic App), Leadership(이메일 다이제스트). 이는 탐지와 대응을 분리하고, 맞춤화되고 신뢰할 수 있는 인시던트 라우팅을 가능하게 합니다.
- 가용성 및 사용자 경험
- 스토어프런트 및 체크아웃 API에 대해 엄격한 SSL 및 콘텐츠 어설션을 포함하는 다중 지역 Application Insights 가용성 테스트를 구성합니다. 이 방식을 선택한 이유는 내부 메트릭과 독립적으로 외부 고객에게 영향을 미치는 문제를 감지하기 위함입니다.
- 운영 대시보드
- 메트릭, KQL 차트, 추적 및 로그로 연결되는 드릴스루(drill-through) 링크를 결합하고 매개변수(구독, 지역, 환경)를 사용하는 Azure Monitor Workbooks를 구축합니다. 통합 문서 JSON의 IaC 배포를 채택합니다. Workbooks는 NOC와 SRE를 위한 공유 가능하고 상호작용적인 ‘페이지 위 런북(runbooks-on-a-page)‘을 제공합니다.
- 비용 거버넌스
- 구독별 및 부서 태그별로 예산을 설정하고 50/80/100% 도달 시 Logic App을 트리거하여 담당자에게 알리고 ITSM 티켓을 여는 경고를 구성합니다. Cost Analysis의 분할 상환 보기(amortized views)를 사용하고 예약 및 절약 플랜 권장 사항을 활성화합니다. 안정적인 SQL MI 워크로드에는 3년 예약을 구매하고, 변동이 심한 컴퓨팅에는 절약 플랜을 구매합니다. 이를 통해 자동화된 가드레일로 20% 비용 절감 목표를 직접 달성할 수 있습니다.
- Advisor 및 Service Health
- 매주 Azure Advisor를 검토하고, 적정 크기 조정(right-sizing) 및 영역 중복성(zone redundancy)을 위한 백로그 항목을 생성합니다. 사용 중인 지역 및 서비스에 대한 Service Health 경고를 구성하여 대기 중인(on-call) 작업 그룹으로 전달합니다. 이를 통해 지속적인 개선과 신속한 플랫폼 인시던트 인지를 보장합니다.
- 규정 준수 및 플릿 보고
- 필수 태그를 강제하고, NIC에 공용 IP를 허용하지 않으며, 진단 설정을 요구하는 Azure Policy 이니셔티브를 할당합니다. 승인된 예외에 대해서는 만료 기한이 있는 예외(exemption)를 사용합니다. 관리 ID(managed identity)로 수정 작업을 구성합니다. Azure Resource Graph를 사용하여 모든 구독에 걸쳐 정책 준수 여부와 태그가 없는 자산을 쿼리하고, 감사용으로 Workbooks에 결과를 표시합니다. 이를 통해 측정 가능한 규정 준수를 갖춘 감사 가능하고 자동화된 거버넌스를 구축할 수 있습니다.
- 배포 변경 보고
- Log Analytics에서 AzureActivity를 쿼리하여 ARM 배포를 찾고, 이를 정책 평가 로그와 연관시켜 월간 보고서를 생성한 후 Logic App을 통해 이메일로 보냅니다. 이는 사용자 지정 에이전트 없이 활동 로그(Activity Log)를 배포 이벤트의 신뢰할 수 있는 소스로 활용하는 방법입니다.
- 자동화된 복구 및 패치
- Azure Automation Runbook을 사용하여 하트비트 경고가 발생했을 때 AKS API를 통해 비정상 파드(pod)를 재시작하고 Key Vault의 비밀을 순환시킵니다. 유지 관리 기간 및 동적 그룹을 사용하여 패치 준수를 위해 Azure Update Manager를 활성화합니다. Hybrid Runbook Workers는 네트워크에 바인딩된 작업을 안전하게 실행합니다. 이를 통해 탐지에서 해결까지의 루프를 완성하고 플릿을 최신 상태로 유지합니다.
선택된 각 서비스는 사용자 지정 개발을 최소화하고, 여러 구독에 걸쳐 확장 가능하며, 명확한 운영 소유권을 유지하면서 거버넌스, 비용 및 안정성 목표에 부합합니다.
← 통합 및 메시징 아키텍처 · 모든 도메인 · 마이그레이션 및 현대화 →
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →