Microsoft AZ-104: Azure Monitor, 백업 및 사이트 복구 — 학습 가이드
다음의 일부입니다: Microsoft Azure Administrator Associate AZ-104 — 학습 가이드. 검증된 답안으로 연습하기: Microsoft 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
개요
Azure에서의 운영 우수성은 관찰 가능한 텔레메트리, 복구 가능한 데이터, 복원력 있는 연속성 계획이라는 세 가지 핵심 요소가 함께 작동해야 합니다. Azure Monitor와 그 기반인 Log Analytics는 고정밀 메트릭과 로그를 수집하고, 지능형 경고를 구동하며, 애플리케이션 성능을 파악할 수 있게 합니다. Azure Backup은 정책 기반의 자격 증명 모음(vault) 기반 복구를 통해 플랫폼 및 IaaS 데이터를 보호하며, 최소한의 가동 중지 시간을 위한 즉시 복원 기능을 포함합니다. Azure Site Recovery (ASR)는 워크로드를 대체 사이트로 복제하고 장애 조치(failover) 및 장애 복구(failback)를 오케스트레이션하여 비즈니스의 RPO/RTO를 충족합니다. 보완적인 서비스인 Network Watcher(네트워크 진단용)와 Azure Service Health(플랫폼 인식용)는 완벽한 관리자 툴킷을 완성합니다.
Azure Monitor 및 Log Analytics
Azure Monitor는 플랫폼 메트릭과 로그를 통합합니다. 메트릭은 거의 실시간 분석에 최적화된 숫자 시계열 데이터입니다(높은 카디널리티, 다차원, 대부분의 리소스에 대해 1분 단위 세분성). 시각화를 위해서는 Metrics Explorer를 사용하고, 정적 또는 동적 임계값을 사용한 거의 실시간 메트릭 경고를 설정할 수 있습니다. 로그는 Log Analytics 작업 영역에 저장되는 스키마가 풍부한 레코드로, Kusto Query Language (KQL)를 사용하여 조사, 대시보드 및 예약된(로그) 경고를 위해 쿼리합니다.
진단 설정은 리소스에서 텔레메트리 싱크로 데이터를 보내는 다리 역할을 합니다. 각 Azure 리소스에서 진단 설정을 구성하여 범주(플랫폼 메트릭, 플랫폼 로그, 리소스 로그)를 선택하고 하나 이상의 대상으로 라우팅합니다:
- 분석 및 로그 기반 경고를 위한 Log Analytics 작업 영역
- 장기적이고 저렴한 보존 및 규정 준수를 위한 Storage 계정
- SIEM 또는 타사 도구로 스트리밍하기 위한 Event Hubs
Log Analytics 작업 영역을 신중하게 설계해야 합니다:
- 작업 영역 범위 및 액세스: 최소 권한 원칙 및 운영 경계(예: 환경 및 지역별)에 맞추기 위해 작업 영역 및 테이블 수준에서 RBAC를 사용합니다. 리소스 컨텍스트 쿼리를 사용하면 로그가 중앙 집중화되어 있더라도 팀이 액세스 권한이 있는 리소스 범위로 로그를 쿼리할 수 있습니다.
- 데이터 수집: 레거시 에이전트보다 데이터 수집 규칙(DCRs)이 있는 Azure Monitor agent (AMA)를 사용하는 것이 좋습니다. DCR은 수집할 대상(성능 카운터, Windows/Linux 이벤트 로그, syslog, 사용자 지정 텍스트 로그), 수집할 머신, 수집할 테이블을 정의하여 세분화된 범위별 파이프라인을 가능하게 합니다.
- 비용 및 보존: 테이블별 보존, 보관 및 적절한 경우 기본 로그를 사용하여 비용을 제어합니다. 가능하면 수집 시 샘플링 및 필터링을 사용합니다.
- 데이터 원본: Azure Activity Log, 진단 설정을 통한 리소스 로그, VM insights 및 Container insights, Azure AD 로그인 및 감사 로그(진단 설정을 통해), Azure Firewall/NSG 흐름 로그, 사용자 지정 애플리케이션 로그, Azure Monitor agent를 통한 온프레미스 데이터.
KQL 숙달은 필수적입니다. 예시:
- 빠른 감사:
undefined
- 성능 분류:
undefined
- 오류율:
undefined
작업 그룹은 경고에 응답할 대상과 방법을 정의합니다: 이메일/SMS/푸시/음성, 보안 웹후크, ITSM 커넥터, Functions, Logic Apps, Automation runbook. 여러 경고 규칙에서 작업 그룹을 재사용하여 일관된 인시던트 라우팅을 적용합니다.
Azure Monitor는 여러 경고 유형을 지원합니다:
- 메트릭 경고: 정적 임계값 또는 정상 기준선을 학습하는 동적 임계값을 사용하여 거의 실시간 주기로 플랫폼 또는 사용자 지정 메트릭을 평가합니다.
- 로그(예약된 쿼리) 경고: 구성된 빈도로 작업 영역 데이터에 대해 KQL을 실행하고, 결과 수 또는 숫자 집계에 따라 트리거합니다. 리소스 전반의 복잡한 패턴에 유용합니다.
- 활동 로그 경고: 제어 평면 이벤트(예: VM이 삭제되거나 역할 할당이 변경될 때)에 대해 트리거됩니다. 이 경고는 작업 영역이 필요하지 않습니다.
- 스마트 검색: 주로 Application Insights 리소스를 위한 변칙 탐지 및 오류율 급증을 감지합니다. 소유자에게 자동으로 알리고 작업 그룹과 통합할 수 있습니다.
Application Insights 및 경고
Application Insights는 코드와 플랫폼을 계측하여 엔드투엔드 애플리케이션 텔레메트리를 제공합니다. 연결 문자열과 최고 수준의 SDK(.NET, Java, Node.js, Python) 또는 공급업체 중립적인 추적을 위해 OpenTelemetry를 사용합니다. PaaS 서비스(App Service, Functions, AKS)의 경우, 코드 변경 없이 요청, 종속성, 예외 및 추적을 캡처하기 위해 사용 가능한 경우 자동 계측을 활성화합니다. 클라이언트, API 및 백엔드 홉을 상호 연관시키기 위해 분산 추적 컨텍스트를 유지합니다.
주요 텔레메트리 유형:
- 요청: 응답 코드와 기간을 포함한 들어오는 작업
- 종속성: 기간과 성공 여부를 포함한 아웃바운드 호출(HTTP, SQL, 큐)
- 예외 및 추적: 심각도를 포함한 오류 및 진단 로그
- 메트릭: 사용자 지정 또는 표준 카운터
- 페이지 보기 및 브라우저 타이밍: 프런트엔드 성능
- 사용자 지정 이벤트 및 측정: 도메인별 신호
신호 충실도를 잃지 않으면서 수집 볼륨을 제어하기 위해 적응 샘플링을 적용하고, 인시던트 중 짧은 대기 시간으로 인사이트를 얻기 위해 Live Metrics Stream을 사용합니다.
가용성 테스트는 외부 연결성 및 SLA를 검증합니다:
- 표준(URL ping) 테스트: 여러 Azure 지역에서 엔드포인트를 프로브하고, 상태 코드, SSL 만료 기간, 콘텐츠 일치 및 응답 시간 임계값을 검증합니다.
- 사용자 지정 테스트: 가상 워크플로 또는 보호된 엔드포인트에 대해 코드에서 TrackAvailability를 사용합니다. 실패 시 작업 그룹에 연결된 경고를 자동으로 생성할 수 있습니다.
Application Insights의 스마트 검색으로 경고 기능을 강화할 수 있습니다:
- 오류 변칙 및 성능 저하
- 메모리 누수 및 종속성 변칙 이러한 기능은 일반적인 패턴을 학습하고 가양성(false positive)을 줄여 임계값 기반 경고를 보완합니다.
Azure Backup
Recovery Services vault는 백업 관리, 정책 및 복구의 중심점 역할을 합니다. 보호 대상 리소스와 동일한 지역에 vault를 배치하거나, 서비스에서 지원하는 지역 간 복원 시나리오의 경우 쌍을 이루는 지역(paired region)에 배치합니다. 일시 삭제(soft delete), 제거 보호(purge protection), 중요 작업에 대한 다중 사용자 권한 부여(multi-user authorization) 기능으로 vault의 보안을 강화합니다.
백업 정책은 일정과 보존 기간을 정의합니다:
- Azure VM 백업: 단기 보존이 포함된 일일 스냅샷, 선택적으로 주간/월간/연간 장기 보존이 가능합니다. 활성화 시 VSS(Windows) 또는 사전/사후 스크립트(Linux)를 통해 애플리케이션 일치 복구 지점을 생성합니다.
- Azure Files 백업: 공유 스냅샷을 기반으로 하는 일일 백업. 비즈니스 요구 사항에 따라 보존 기간을 설정하며, 항목 수준 복구를 통해 원본 또는 대체 공유로 복원을 지원합니다.
- Azure VM의 SQL Server: 전체(매일/매주), 차등(매일), 로그(최소 15분마다) 백업을 통해 특정 시점 복원(point-in-time restore)이 가능합니다. 자동 보호(Auto-protect) 기능으로 새 데이터베이스를 검색합니다.
Instant Restore는 vault의 심층 스토리지에 저장되기 전 짧은 기간 동안 로컬에 저장된 스냅샷을 사용하여 VM 복구 속도를 높입니다. 관리자는 다음을 수행할 수 있습니다:
- 전체 VM을 복원(새 컴퓨팅)하여 복구 시간을 최소화합니다.
- 디스크를 복원하고 기존 VM에 다시 연결하여 특정 부분을 복구합니다.
- 복구 지점을 임시 iSCSI 디바이스로 구독 내 모든 VM(역할이 허용된)에 탑재하여 파일 및 폴더 복구를 수행하고, 랜섬웨어와 같은 이벤트 발생 후 정밀한 복원을 지원합니다.
VM 백업 고려 사항에는 중요하지 않은 데이터에 대한 디스크 제외, 암호화 처리(Azure Backup은 암호화된 디스크 지원), 일관성 모델(크래시 일관성 vs 애플리케이션 일관성)이 포함됩니다. Azure Files 백업은 스토리지 스냅샷을 활용하여 증분 방식의 공간 효율적인 보존 및 일시 삭제(soft delete) 보호의 이점을 얻습니다. Azure VM의 SQL 백업은 vault와 연동되는 워크로드 인식 확장 프로그램을 사용하여 Always On 가용성 그룹 및 독립 실행형 인스턴스 전반에 걸쳐 규정을 준수하는 복원 가능한 체인을 생성합니다.
Azure Site Recovery, Network Watcher, 및 Service Health
ASR은 워크로드 복제 및 오케스트레이션된 복구를 제공합니다:
- 복제 원본: 온프레미스 VMware/Hyper-V/물리적 서버에서 Azure로, Azure 지역 간. 보호된 머신의 Mobility service가 변경 사항을 캡처하여 캐시/대상 스토리지로 복제합니다. 쓰기 순서를 공유하는 계층화된 앱의 경우 다중 디스크 일관성을 활성화합니다.
- 대상 구성: 리소스 그룹, VNet/서브넷, 가용성 옵션(영역/집합), 관리 디스크 유형 및 이름 지정 규칙을 미리 생성하거나 매핑합니다. 네트워크 매핑 및 DNS 업데이트를 사용하여 장애 조치(failover) 후 연결성을 보장합니다.
- 장애 조치(Failover) 옵션: 테스트 장애 조치(프로덕션에 영향 없이 격리된 검증), 계획된 장애 조치(원본 시스템 종료로 데이터 손실 없음), 계획되지 않은 장애 조치(중단 시 최선의 노력). 장애 조치 후, 복제를 역방향으로 전환하기 위해 다시 보호(Reprotect)합니다. 원본에 따라 프로세스 서버 또는 직접 복제를 통해 기본 사이트가 준비되면 장애 복구(Failback)합니다.
- 복구 계획: 그룹, 수동 승인 단계, Azure Automation Runbook 또는 스크립트(앱 준비, 부하 분산 장치 재구성, DNS 변경용)를 사용하여 다중 VM 계층을 오케스트레이션합니다. 예측 가능한 RTO를 달성하기 위해 순서 지정 및 시간 초과를 포함시킵니다.
RPO/RTO 목표는 정책을 결정합니다:
- RPO(허용 가능한 데이터 손실)는 변경률, 네트워크 처리량, 복제 빈도에 따라 결정됩니다. RPO 임계값을 설정하여 초과 시 상태 경고를 발생시킵니다.
- RTO(서비스 복원 시간)는 부팅 시간, 오케스트레이션 단계, DNS/연결 업데이트, 데이터 평면 작업(디스크 연결)에 따라 달라집니다. 복구 계획을 조정하고, 용량을 사전 프로비저닝하며, 테스트 장애 조치를 사용하여 목표 달성 여부를 검증합니다.
- 복제 정책은 스토리지 비용, 복구 유연성 및 성능의 균형을 맞추기 위해 애플리케이션 일관성 스냅샷 주기와 복구 지점 보존 기간을 정의합니다.
Azure Network Watcher는 관리자에게 정밀한 네트워크 진단 도구를 제공합니다:
- IP 흐름 확인: NIC의 유효 NSG 규칙에 의해 흐름이 허용되는지 또는 거부되는지 확인하고, 결정에 영향을 미치는 특정 규칙을 식별합니다.
- 다음 홉: 주어진 대상(인터넷, 가상 네트워크, 가상 어플라이언스)에 대한 라우팅 결정을 계산하여 유효한 사용자 정의 경로 및 시스템 경로를 보여줍니다.
- 연결 문제 해결: VNet 및 하이브리드 링크를 통해 원본과 대상 간의 종단 간 프로브를 실행하여 연결성, 대기 시간 및 장애 발생 지점을 보고합니다.
- 패킷 캡처: VM NIC에서 필터(프로토콜/포트/IP)를 사용하여 패킷을 캡처하고, 스토리지 계정이나 로컬에 저장하여 간헐적인 문제의 심층 분석에 유용합니다. VM에 Network Watcher 확장이 필요합니다.
Azure Service Health는 플랫폼 인식을 통해 모니터링을 보완합니다:
- 서비스 문제: 선택한 서비스 및 지역에 영향을 미치는 실시간 중단 및 성능 저하 이벤트와 근본 원인 및 완화 업데이트를 제공합니다.
- 계획된 유지 관리: 워크로드에 영향을 줄 수 있는 예정된 플랫폼 유지 관리 기간에 대한 알림과 일정 및 필요한 조치를 제공합니다.
- 상태 권고: 구성 변경이 필요할 수 있는 모범 사례 및 보안 권고를 제공합니다. 서비스/지역/구독을 범위로 하는 Service Health 경고를 생성하고 작업 그룹을 통해 라우팅하여 운영팀이 영향 발생 전에 정보를 받도록 하십시오. 리소스별 가용성 상태(사용 가능, 성능 저하, 사용 불가, 알 수 없음)를 확인하려면 Resource Health를 사용하여 플랫폼 문제와 워크로드 문제를 구별하십시오.
실제 문제 시나리오
Adobe는 엄격한 관찰 가능성, 백업, 재해 복구 목표를 충족하면서 빠른 네트워크 문제 해결 및 플랫폼 인식을 보장하는 새로운 2개 지역 Azure 기반 전자 상거래 플랫폼을 강화하고 운영화해야 합니다.
지역별로 중앙 Log Analytics 작업 영역을 배포하고 모든 VM 및 AKS 노드에 데이터 수집 규칙(Data Collection Rules)을 연결하여 진단 설정을 통해 성능, syslog/EventLog 및 리소스별 로그를 수집합니다. 이유: 지역별 작업 영역은 데이터 상주 및 성능을 유지합니다. AMA+DCR은 세분화되고 확장 가능한 수집 및 비용 제어를 제공합니다.
App Service, Key Vault, Azure Firewall, Application Gateway, Storage에 대한 진단 설정을 구성하여 로그와 메트릭을 지역별 작업 영역 및 장기 보존을 위한 스토리지 계정으로 라우팅합니다. 이유: 중앙 집중식 분석은 리소스 간 상관관계 분석을 가능하게 합니다. 스토리지 보존은 규정 준수 및 포렌식 요구 사항을 충족합니다.
OpenTelemetry를 사용하여 웹 및 API 계층을 Application Insights로 계측하고 App Service에서 자동 계측을 활성화합니다. 콘텐츠 일치 및 TLS 만료 확인 기능이 있는 최소 5개 Azure 지역에서 가용성 테스트를 생성합니다. 이유: 심층 분산 추적 및 합성 테스트는 고객보다 먼저 사용자에게 영향을 미치는 성능 저하를 탐지합니다.
Azure Monitor 경고 생성:
- CPU, 메모리, HTTP 5xx 비율, App Gateway 백엔드 상태에 대한 동적 메트릭 경고
- KQL을 사용하여 비정상적인 방화벽 거부 및 실패한 로그인에 대한 예약된 쿼리 경고
- 중요 리소스에 대한 삭제/역할 할당 이벤트에 대한 활동 로그 경고
- 모든 경고를 공유 작업 그룹(대기 중인 담당자를 위한 이메일/SMS, ITSM으로의 웹훅, 인시던트 생성을 위한 Logic App)에 연결합니다. 이유: 다중 신호 경고는 사람과 시스템에 실행 가능한 라우팅을 제공하여 평균 탐지 시간(MTTD)을 단축합니다.
- Azure Backup으로 데이터 보호:
- 야간 백업 및 장기 보존에 맞는 정책으로 VM 백업을 활성화하고, 해당되는 경우 애플리케이션 일관성 스냅샷을 활성화합니다.
- 일일 백업 및 일시 삭제 기능으로 미디어 자산을 호스팅하는 Azure Files 공유를 보호합니다.
- 특정 시점 복원을 지원하기 위해 전체/차등/로그 스케줄로 Azure VM의 SQL Server를 보호합니다.
- 스테이징 환경에서 파일 수준 복원을 수행하여 즉시 복원(Instant Restore)을 검증합니다. 이유: Vault 기반 백업 및 즉시 복원은 IaaS 및 파일 워크로드 전반에 걸쳐 다운타임과 데이터 손실을 최소화합니다.
낮은 RPO와 시간별 애플리케이션 일관성 지점을 목표로 하는 복제 정책을 사용하여 웹, API, SQL 계층의 지역 간 DR을 위해 Azure Site Recovery를 구현합니다. 계층(데이터 우선, 그 다음 API, 웹 순)이 있는 복구 계획을 구축하고, DNS 업데이트 및 CDN 캐시 제거를 위한 자동화, 분기별로 격리된 VNet에서 테스트 장애 조치를 수행합니다. 이유: ASR 복제 및 복구 계획은 오케스트레이션되고 감사 가능한 Runbook과 무중단 테스트를 통해 예측 가능한 RTO를 제공합니다.
Network Watcher를 활성화하고 연결 문제 해결(Connection troubleshoot)을 사용하여 프런트엔드-백엔드 간 흐름을 검증하고, 다음 홉(Next hop)을 사용하여 NVA 계층을 통한 UDR을 확인하며, IP 흐름 확인(IP flow verify)을 사용하여 NSG 강화를 확인합니다. 간헐적인 시간 초과 분석을 위해 API VM에서 주문형 패킷 캡처를 구성합니다. 이유: 특수 목적의 진단 도구는 라우팅/NSG 문제를 신속하게 격리하고 필요할 때 패킷 수준의 증거를 제공합니다.
해당 범위의 두 지역 및 서비스(App Service, SQL, Storage, Key Vault, Front Door)에 대한 Azure Service Health 경고를 생성합니다. 동일한 작업 그룹으로 라우팅하고 계획된 유지 관리 권고를 위해 리더십 배포 목록을 포함합니다. 이유: 플랫폼 인시던트 및 유지 관리에 대한 사전 인식을 통해 예기치 않은 중단을 방지하고 조정된 커뮤니케이션을 가능하게 합니다.
이러한 통합된 접근 방식을 통해 Adobe는 RPO/RTO 목표를 달성하고, 랜섬웨어나 운영자 실수로부터 신속하게 복원하며, 몇 분 내에 이상 징후를 탐지 및 해결하고, Azure 플랫폼 이벤트를 지속적으로 파악하면서 네트워크 경로를 확실하게 문제 해결할 수 있습니다.
← Azure 데이터베이스 및 데이터 서비스 · 모든 도메인 · Azure 보안 및 규정 준수 →
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →