Microsoft AZ-305: 고가용성, 재해 복구 및 비즈니스 연속성 — 학습 가이드
다음의 일부입니다: Microsoft Azure Solutions Architect Expert AZ-305 — 학습 가이드. 검증된 답안으로 연습하기: Microsoft 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
개요
Azure에서의 고가용성(HA), 재해 복구(DR), 비즈니스 연속성(BC)은 컴퓨팅, 데이터, 네트워킹 계층 전반에 걸쳐 신중한 설계가 필요합니다. 복원력은 명확한 복구 시간 목표(RTO)와 복구 지점 목표(RPO)를 설정하는 것에서 시작하며, 이후 플랫폼 기능(Availability Zones, 글로벌 라우팅, 데이터 복제, 백업, 장애 조치 오케스트레이션)을 조합하여 테스트되고 자동화된 전략을 구성합니다. Azure는 영역 및 지역 장애 격리, DNS 및 애니캐스트 기반 글로벌 배포, 다중 지역 데이터 내구성, 정책 기반 백업/복원을 제공하여 비용과 운영 복잡성을 제어하면서 엄격한 목표를 충족시킵니다.
RTO/RPO 기반 아키텍처 및 영역/글로벌 복원력
설계는 RTO와 RPO에서 시작됩니다. RTO는 장애 발생 후 서비스가 얼마나 빨리 재개되어야 하는지를 결정하고, RPO는 허용 가능한 최대 데이터 손실량을 결정합니다. 낮은 RTO를 충족하려면 자동화된 장애 조치와 사전 프로비저닝된 용량이 필요하며, 낮은 RPO를 충족하려면 동기식 또는 거의 동기식에 가까운 복제와 빈번하고 일관된 복구 지점이 필요합니다.
Availability Zones는 한 지역 내에 있는 독립적인 데이터 센터 장애 도메인입니다. 영역 서비스(예: Virtual Machines, 관리 디스크, Standard 공용 IP)는 단일 영역에 고정됩니다. 영역 중복 서비스(예: Azure Load Balancer Standard 영역 중복 프런트엔드, 영역 중복 스토리지 제품, 영역 중복 Azure SQL 계층)는 자동으로 여러 영역에 걸쳐 확장됩니다. 일반적인 복원력 패턴은 최소 두 개의 영역에 영역별 VM을 배포하고, 단일 가상 네트워크에 배치한 다음, 영역 중복 부하 분산 프런트엔드를 노출하는 것입니다. 이를 통해 단일 영역 장애로 인한 다운타임을 제거할 수 있습니다.
글로벌 에지에서는 DNS 기반과 애니캐스트 프록시 기반 부하 분산 중에서 선택합니다.
- Azure Traffic Manager는 DNS 기반입니다. 성능(가장 낮은 대기 시간), 가중치(A/B 테스트 및 점진적 트래픽 전환), 우선순위(활성/수동 장애 조치), 지리적(지역 규정을 준수하는 엔드포인트에서 사용자에게 서비스 제공), 다중값(단순 클라이언트를 위해 여러 개의 정상 IPv4/IPv6 레코드 반환), 서브넷(클라이언트 IP 범위를 특정 엔드포인트에 매핑)과 같은 라우팅 방법을 사용하여 클라이언트를 엔드포인트로 안내합니다. DNS 기반이므로 Traffic Manager는 콘텐츠를 가속화하거나 트래픽을 프록시하지 않습니다. 클라이언트는 선택된 엔드포인트에 직접 연결하고 로컬 DNS 캐싱 동작을 따릅니다.
- Azure Front Door(Standard/Premium)는 지능형 라우팅, TLS 오프로드, 통합 웹 애플리케이션 방화벽(WAF)을 갖춘 글로벌 애니캐스트 HTTP/HTTPS 역방향 프록시입니다. 라우팅 규칙은 도메인, 경로, 메서드, 헤더를 기준으로 일치 항목을 찾은 다음 원본 그룹으로 라우팅합니다. 규칙 엔진 작업은 URL/헤더를 다시 작성하고 리디렉션을 강제할 수 있습니다. 상태 프로브는 구성 가능한 경로와 프로토콜에서 원본 상태를 지속적으로 평가하며, 비정상 원본은 로테이션에서 제거됩니다. 원본 그룹은 지역 간 우선순위(활성/수동) 및 가중치 기반 분산을 지원합니다. WAF 정책은 엔드포인트 또는 경로에 연결되며, 관리형 규칙 집합, 사용자 지정 규칙, 속도 제한을 통해 OWASP 위협과 악의적인 클라이언트를 완화합니다. 가속, 에지 보안, 애플리케이션 인식 장애 조치가 포함된 글로벌 부하 분산이 필요할 때 Front Door를 사용하고, 비-HTTP 엔드포인트나 DNS 수준 제어가 필요할 때만 Traffic Manager와 결합하여 사용합니다.
계층 4에서 Azure Load Balancer는 TCP/UDP에 대해 매우 낮은 대기 시간의 부하 분산을 제공합니다. Standard Load Balancer는 영역 및 영역 중복 프런트엔드, HA 포트, 아웃바운드 규칙, 기본적으로 보안이 적용되는 동작(명시적인 NSG 및 백엔드 풀 구성)을 지원합니다. 상태 프로브(TCP/HTTP)는 백엔드 상태를 확인하며, 장애 발생 시 인스턴스를 로테이션에서 제거합니다. Basic Load Balancer는 영역 인식이 없고 고급 기능과 SLA가 없으므로 프로덕션 환경에서는 사용을 피해야 합니다. Cross-region Load Balancer는 지역별 Standard Load Balancer 간에 부하를 분산하는 글로벌 애니캐스트 프런트엔드를 추가하여, 비-HTTP 워크로드에 대한 활성/활성 다중 지역 설계를 가능하게 하고 상태 기반의 빠른 지역 장애 조치를 제공합니다.
데이터 보호 및 재해 복구: Azure Backup 및 Site Recovery
Azure Backup은 특정 시점 복구를 제공하고, Azure Site Recovery(ASR)는 워크로드 복제 및 오케스트레이션된 장애 조치를 제공합니다. 이 둘은 상호 보완적인 요구 사항을 해결하며 종종 함께 사용됩니다.
Azure Backup 자격 증명 모음 옵션:
- Recovery Services 자격 증명 모음은 Azure VM, Azure VM의 SQL Server, Azure VM의 SAP HANA, Azure Files 및 MARS/MABS 에이전트를 보호합니다. 지원되는 경우 일정, 보존 기간, 애플리케이션 일치 백업을 정의하는 백업 정책과 통합됩니다.
- Backup 자격 증명 모음은 Azure Disks 백업 및 Azure Blobs 백업과 같은 최신 워크로드를 위한 현대화된 자격 증명 모음으로, 지원되는 지역에서 세분화된 RBAC 및 영역 중복 자격 증명 모음 스토리지를 제공합니다. 워크로드 및 거버넌스 모델에 맞는 자격 증명 모음 유형을 선택하세요.
백업 정책은 백업 실행 시점, 보존 계층(매일/매주/매월/매년), 일관성 설정을 관리합니다. 일시 삭제는 삭제된 백업 항목을 복원할 수 있는 안전 기간을 추가하여 우발적이거나 악의적인 삭제로부터 보호합니다. 지역 간 복원은 자격 증명 모음 스토리지가 지역 중복 옵션을 사용할 때 보조 지역에서 복원을 활성화합니다. 이 기능은 활성화해야 하며, 지역별 기능 지원 및 데이터 평면 준비 상태에 따라 달라집니다.
Azure Site Recovery는 영역 또는 지역 간에 워크로드를 복제하고 엔드투엔드 DR을 오케스트레이션합니다:
- 복제 정책은 스냅샷 빈도, 복구 지점 보존 기간, 앱 일치 스냅샷 주기, RPO 경고 임계값을 정의합니다. 정책은 복제 대역폭, 스토리지 비용, 복구 정밀도 간의 균형을 맞춥니다.
- 복구 계획은 그룹(예: 데이터베이스, API, 웹), 사전/사후 단계, Azure Automation runbook, 스크립트 또는 수동 작업을 통한 자동화를 통해 다중 계층 애플리케이션의 순서 있는 장애 조치를 제공합니다. 계획에 DNS 변경, Traffic Manager/Front Door 엔드포인트 업데이트, 애플리케이션 구성을 통합하세요.
- 테스트 장애 조치는 프로덕션이나 복제에 영향을 주지 않고 비프로덕션 VNet 또는 테스트 네트워크를 사용하여 격리된 복구를 실행하여 runbook, 부팅 순서, 애플리케이션 상태를 검증합니다. RTO를 검증하려면 정기적인 테스트가 필수적입니다.
- 장애 복구(Failback)는 워크로드가 정상 상태일 때 원래 사이트나 지역으로 되돌립니다. 장애 조치 후, 새로운 주 방향으로 워크로드를 다시 보호하고, 변경 사항을 동기화하고, 계획된 장애 복구 기간을 예약하고, 장애 복구 후 복제를 확인합니다. Azure-to-Azure 시나리오의 경우, 일반적으로 페어링된 지역 간에 장애 조치를 수행하고 준비가 되면 복제를 반대로 하여 원래 토폴로지를 복원합니다.
데이터 계층 연속성: Azure SQL, Storage 복제 및 Cosmos DB
각 데이터 서비스는 애플리케이션 일관성 요구 사항과 일치해야 하는 고유한 내구성 및 장애 조치 의미 체계를 노출합니다.
Azure SQL Database 및 Azure SQL Managed Instance:
- 활성 지역 복제는 단일 데이터베이스 또는 탄력적 풀에 대해 최대 4개의 읽기 가능한 보조 복제본을 생성합니다. 데이터베이스 수준 복제와 수동 또는 API 기반 장애 조치를 제공하여 읽기 확장(read-scale) 및 DR을 지원합니다. 데이터베이스별 제어와 사용자 지정 오케스트레이션이 필요할 때 적합합니다.
- 자동 장애 조치 그룹은 리스너 엔드포인트와 함께 장애 조치되는 데이터베이스 그룹(또는 전체 관리형 인스턴스)을 생성합니다. 지역 간 장애 조치 및 연결 문자열 관리를 단순화하고 유예 기간 후 자동 장애 조치를 지원합니다. 조정된 장애 조치와 단순화된 클라이언트 연결이 필요한 다중 데이터베이스 애플리케이션에 장애 조치 그룹을 사용하세요.
- 영역 중복성은 지역 내 여러 영역에 복제본을 배치하여 지역 간 복구 없이 영역 장애에서 복구할 수 있도록 합니다. 지원하는 계층에서 이 기능을 활성화하여 대기 시간 프로필을 변경하지 않고 로컬 가용성을 향상시키세요.
Azure Storage 복제 옵션:
- GRS(지역 중복 스토리지)는 주 지역(3개 복사본)에서 페어링된 보조 지역(3개 복사본)으로 데이터를 비동기적으로 복제합니다. 정상 작동 중에는 읽기 및 쓰기 작업이 주 지역을 대상으로 합니다.
- RA-GRS는 주 지역의 성능이 저하되었을 때 긴급 보고나 분석과 같은 시나리오를 위해 보조 엔드포인트에 대한 읽기 액세스를 추가합니다.
- GZRS(지역 영역 중복 스토리지)는 주 지역의 ZRS를 통한 영역 내구성과 보조 지역으로의 비동기 복제를 결합하여 로컬 및 지역 복원력을 모두 향상시킵니다.
- RA-GZRS는 GZRS 계정의 보조 복제본에 대한 읽기 액세스를 추가합니다. 주 지역을 복구할 수 없는 경우, 보조 지역으로 계정 장애 조치를 시작할 수 있습니다. 장애 조치 후, 스토리지 계정은 보조 지역에서 주 계정이 되며 일반적으로 로컬 중복으로 되돌아갑니다(다시 구성할 때까지). 비동기 복제로 인해 약간의 RPO가 예상되므로, 애플리케이션은 장애 조치 후 멱등성 및 조정을 처리해야 합니다.
Azure Cosmos DB:
- 다중 지역 쓰기는 충돌 해결 정책(지정된 속성을 통한 마지막 쓰기 우선, 사용자 지정 또는 다중 마스터 전략)을 사용하여 구성된 모든 지역에 쓰기를 허용합니다. 이를 통해 쓰기 대기 시간을 줄이고 가용성을 높일 수 있습니다.
- 자동 장애 조치는 우선순위가 지정된 지역 목록을 사용하여 중단 시 새로운 쓰기 지역을 승격시킵니다. 선택한 일관성 수준(강력(Strong)에서 최종(Eventual)까지)과 결합하여 가용성과 일관성 간의 절충 관계를 관리합니다.
- SLA는 가용성, 처리량, 대기 시간, 일관성을 보장합니다. 다중 지역 쓰기를 사용하면, 올바른 다중 지역 구성 시 Cosmos DB는 읽기 및 쓰기 모두에 대해 최대 99.999%의 가용성을 제공합니다. 이러한 보장을 최대한 활용하려면 엔드포인트 검색 및 재시도 기능을 갖춘 SDK를 사용하여 클라이언트를 설계해야 합니다.
종합: 특정 복구 목표 충족하기
RTO/RPO 및 장애 도메인을 기준으로 각 계층을 연속성 메커니즘에 매핑합니다.
- 리전 내 가용성: Availability Zones를 사용합니다. 최소 두 개의 영역에 걸쳐 영역(zonal) 컴퓨팅을 배포하고, 영역 중복 프런트엔드(Standard Load Balancer, 영역 중복성이 있는 Application Gateway v2 또는 엣지의 Front Door)를 사용합니다. 지원되는 경우 SQL 영역 중복성을 활성화하고, 영역 및 리전 복원력이 모두 필요한 스토리지에는 GZRS를 사용합니다.
- 리전 간 DR: 상태 저장(stateful) 계층의 경우, 낮은 RPO를 위해 네이티브 지역 복제(SQL 자동 장애 조치 그룹, Cosmos DB 다중 지역 계정, Storage GRS/GZRS)를 사용하는 것이 좋습니다. 네이티브 복제 기능이 없는 상태 저장 IaaS 또는 워크로드의 경우, 잘 조정된 복제 정책 및 복구 계획과 함께 Azure Site Recovery를 사용합니다. 임시(ephemeral) 컴퓨팅의 경우, Infrastructure as Code를 사용하여 이미지 또는 VM Scale Sets에서 재구성합니다.
- 글로벌 라우팅 및 페일오버: HTTP/S의 경우, Azure Front Door는 상태 프로브 기반의 애플리케이션 인식 페일오버 및 WAF 보호 기능을 제공합니다. 비-HTTP 또는 혼합 프로토콜의 경우, 필요에 따라 Traffic Manager(DNS) 또는 Cross-region Load Balancer(L4 애니캐스트)를 추가합니다. 엄격한 액티브/패시브 RTO 목표를 위해서는 우선순위 라우팅을 사용하고, 단계적 롤아웃에는 가중치 라우팅을, 사용자에게 최저 지연 시간을 제공하려면 성능 기반 라우팅을 사용합니다.
- 최후의 방어선으로서의 백업: 복제를 사용하더라도 규정 준수를 충족하는 보존 정책으로 Azure Backup을 유지하고, 영구 삭제 이벤트로부터 보호하기 위해 일시 삭제를 활성화하며, 지역 중복 스토리지를 사용하는 자격 증명 모음(vault)에 대해 리전 간 복원을 구성합니다. 백업은 논리적 손상, 랜섬웨어, 운영자 실수와 같은 위험으로부터 보호하며, 이러한 위험은 복제를 통해 전파될 수 있습니다.
테스트는 필수입니다. 정기적인 ASR 테스트 페일오버를 예약하고, Front Door/Traffic Manager 상태 드릴 테스트를 수행하며, 부하 상태에서 SQL 장애 조치 그룹의 동작을 검증하고, 샌드박스에서 스토리지 페일오버 시뮬레이션을 실행합니다. RTO 측정을 계측하고 런북(runbook)으로 롤백/페일백을 자동화합니다. 온콜(on-call) 담당자가 압박감 속에서도 일관되게 실행할 수 있도록 운영 런북을 문서화하고 반복 훈련합니다.
실제 문제 시나리오
Expedia Group은 핵심 예약 기능에 대해 RTO ≤ 15분, RPO ≤ 5분을 충족하면서 주요 여행 이벤트 기간 동안 10배의 트래픽 급증을 감당할 수 있도록 글로벌 여행 예약 플랫폼을 현대화해야 합니다. 이 플랫폼은 전 세계 웹 및 모바일 클라이언트를 대상으로 HTTP와 비-HTTP 워크로드를 혼합하여 서비스합니다.
- 주 리전(primary region)에 영역 복원력 구축
- 상태 비저장(stateless) 마이크로서비스를 영역별 VM Scale Sets로 두 개 이상의 Availability Zones에 배포하고, Standard Load Balancer 영역 중복 프런트엔드를 사용합니다. 이를 통해 단일 영역 장애 위험을 제거하고 리전 내 낮은 지연 시간의 트래픽을 보장합니다.
- 자동 장애 조치 그룹과 영역 중복성이 활성화된 Azure SQL Database를 사용합니다. 자동 장애 조치 그룹은 조정된 데이터베이스 페일오버와 안정적인 리스너를 제공하여 최소한의 운영 부담으로 15분의 RTO를 충족합니다.
- 세션 아티팩트와 이미지를 GZRS 스토리지 계정에 저장하여 영역 내구성과 비동기식 리전 보호를 결합합니다. 이는 애플리케이션 측의 멱등성(idempotency)과 결합될 때 5분의 RPO를 충족합니다.
- 액티브/액티브 읽기를 통한 리전 간 DR 추가
- 두 개의 페어링된 리전(paired regions)에 있는 예약 웹/API 오리진을 Azure Front Door Standard 뒤에 구성합니다. 상태 프로브와 우선순위 라우팅은 애플리케이션 상태에 따라 신속한 페일오버를 가능하게 하고, 애니캐스트는 사용자 트래픽을 가속화합니다. 관리형 규칙 집합과 속도 제한이 포함된 WAF 정책은 트래픽 급증 시 중요한 대규모(volumetric) 및 애플리케이션 계층 공격으로부터 보호합니다.
- 여행 일정 및 개인화 서비스를 위해 Cosmos DB 다중 지역 쓰기를 활성화하여 전 세계 사용자의 쓰기 지연 시간을 줄이고 99.999%의 가용성을 제공합니다. 자동 페일오버는 보조 리전(secondary region)을 우선시하여 수동 개입 없이 낮은 RTO를 유지합니다.
- 트랜잭션 예약 처리를 위해 동일한 두 리전에 걸쳐 SQL 자동 장애 조치 그룹을 사용하고, 보조 데이터베이스에서 읽기 확장(read-scale)을 활성화하여 보고용으로 사용하면서 신속하고 조정된 페일오버를 보장합니다.
- 상태 보호 및 손상으로부터의 복구 지원
- 레거시 구성 요소가 남아 있는 경우, Azure VM 백업(지원되는 경우 앱 일관성 백업) 및 VM 내 SQL 백업을 위해 Recovery Services 자격 증명 모음(vault)을 사용합니다. 계층화된 보존이 포함된 백업 정책을 적용하고, 우발적이거나 악의적인 삭제로부터 보호하기 위해 일시 삭제를 활성화합니다.
- 특수 워크로드를 호스팅하는 Azure Disks의 경우, Backup 자격 증명 모음 기반의 Azure Disk Backup을 추가하여 게스트 OS 에이전트와 독립적으로 증분 스냅샷을 캡처합니다. 이는 복구 옵션을 다양화합니다.
- 지역 중복 스토리지를 사용하는 자격 증명 모음에서 리전 간 복원을 활성화하여, 부분적인 컨트롤 플레인(control-plane) 중단 시 보조 리전에서 데이터 플레인(data-plane) 복원을 허용합니다.
- DR 오케스트레이션 및 RTO 검증
- 네이티브 복제 기능이 없는 서비스(예: 레거시 Windows 서비스)에 대해 Azure Site Recovery를 구성합니다. 데이터베이스 준비, 그 다음 API, 웹 순서로 시퀀스를 정하는 복구 계획을 생성하고, Key Vault 참조 업데이트, Front Door 규칙을 통한 CDN 캐시 제거, 비-HTTP 엔드포인트에 대한 Traffic Manager 우선순위 전환을 위한 Azure Automation 런북을 포함합니다.
- 런북을 검증하고, 실제 페일오버 소요 시간을 측정하며, 용량 예약을 미세 조정하기 위해 마스킹된 데이터를 사용하여 격리된 VNet으로 분기별 테스트 페일오버를 예약합니다. 테스트 후에는 아티팩트를 정리하고 15분의 RTO 목표에 대해 메트릭을 검토합니다.
- 혼합 프로토콜을 위한 글로벌 라우팅
- HTTP/S의 경우, Front Door가 상태 기반 페일오버와 엣지 보안을 처리합니다. 비-HTTP 프로토콜(예: 파트너 TCP 통합)의 경우, 리전별 Standard Load Balancer를 자식 엔드포인트로 사용하는 Cross-region Load Balancer를 배포합니다. 상태 프로브는 장애가 발생한 리전을 즉시 제거하여 DNS TTL 종속성 없이 연결을 유지합니다. DNS 수준의 지역 제한(geofencing)이 필요한 경우(규제 관련 엔드포인트), 리전별 엔드포인트 앞에 Azure Traffic Manager의 지역(Geographic) 라우팅을 계층화합니다.
이 서비스들을 사용하는 이유
- Availability Zones와 영역 중복 프런트엔드는 최소한의 지연 시간 영향으로 단일 영역 장애를 제거합니다. Azure SQL 장애 조치 그룹은 연결 관리를 추상화하고 페일오버를 자동화하여 15분의 RTO 목표에 부합합니다. Cosmos DB 다중 지역 쓰기는 전 세계적으로 초고가용성 및 낮은 쓰기 지연 시간 요구 사항을 충족합니다. GZRS 및 RA 옵션은 제어된 RPO 절충을 통해 영역 및 리전 내구성을 함께 제공합니다. Front Door는 글로벌 가속, 애플리케이션 인식 페일오버, 엣지에서의 WAF를 제공합니다. Cross-region Load Balancer와 Traffic Manager는 비-HTTP 및 지역 라우팅 요구를 처리합니다. Azure Backup과 ASR은 특정 시점 복원부터 전체 스택 페일오버에 이르는 독립적인 복구 경로를 제공하여, 플랫폼이 인프라 장애와 논리적 데이터 손상 모두로부터 복구할 수 있도록 보장합니다.
← 네트워킹 및 연결성 · 모든 도메인 · 보안 아키텍처 및 제로 트러스트 →
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →