Google ACE: 안정성, 백업 및 재해 복구 — 학습 가이드

다음의 일부입니다: Google Associate Cloud Engineer — 학습 가이드. 검증된 답안으로 연습하기: Google 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

개요

Google Cloud에서의 안정성, 백업, 재해 복구는 장애 도메인, 데이터 보호 메커니즘, 트래픽 관리, 운영 준비 상태 전반에 걸쳐 의도적인 설계가 필요합니다. 이 섹션에서는 영역(zone)과 리전(region)에 걸쳐 서비스를 구성하는 방법, 상태 저장 데이터(stateful data)를 보호하고 복원하는 방법, 그리고 체계적인 런북(runbook)과 지속적인 복원력 테스트를 통해 복구 목표를 검증하는 방법을 설명합니다. 또한 플랫폼이 정의된 복구 시간 목표(RTO) 및 복구 시점 목표(RPO) 내에서 복구될 수 있도록 보장하기 위한 DR 전략의 트레이드오프와 용량 계획에 대해 간략히 설명합니다.

장애 도메인 및 리전 설계

예시:

데이터 보호: 데이터베이스, 스토리지, 컴퓨팅

예시:

예시:

예시: 90일 후 Coldline으로 이동하고 365일 후 삭제하는 수명 주기

트래픽, 용량, 종속성 복원력

복원력 운영 및 지속적인 개선

실용적인 문제 시나리오

Brightlane Retail은 us-central1에서 엄격한 가용성과 주문 데이터에 대한 4시간의 RPO를 요구하는 전자 상거래 플랫폼을 운영하고 있습니다. 경영진은 다운타임 없이 영역(zonal) 장애를 극복하고, 리전(regional) 장애 발생 시 고객 영향을 최소화할 것을 요구합니다.

접근 방식:

  1. HTTP 자동 복구 기능이 있는 리전 MIG와 글로벌 HTTP(S) Load Balancer 구현

    • 근거: 리전 MIG는 인스턴스를 여러 영역에 분산시키고, 애플리케이션 수준의 HTTP 상태 확인은 10초 간격의 검사를 3번 실패한 후 자가 복구를 활성화합니다. 글로벌 로드 밸런서는 비정상 VM을 자동으로 제거하고 정상 영역으로 트래픽을 장애 조치합니다.
    • 명령어: gcloud compute health-checks create http app-hc –check-interval=10s –timeout=5s –unhealthy-threshold=3 –request-path=/healthz gcloud compute instance-groups managed update web-rmig –region=us-central1 –health-check=app-hc –initial-delay=60
  2. Cloud SQL HA를 리전 간 읽기 복제본 및 PITR과 함께 활성화

    • 근거: 리전 HA는 자동 장애 조치를 통해 영역(zonal) 장애로부터의 생존 가능성을 제공합니다. us-east1의 읽기 복제본은 0이 아니지만 제한된 RPO로 리전 DR을 제공합니다. PITR(MySQL의 경우 바이너리 로깅)을 활성화하면 특정 시점으로 복원할 수 있어 논리적 손상을 해결할 수 있습니다.
    • 명령어: gcloud sql instances patch orders-mysql –enable-bin-log –backup-start-time=03:00 gcloud sql instances create orders-replica –master-instance-name=orders-mysql –region=us-east1
  3. Dual-Region Cloud Storage 및 수명 주기 정책으로 객체 자산 보호

    • 근거: 제품 이미지와 정적 자산은 리전 복원력을 위해 이중 리전 버킷에 저장됩니다. 수명 주기 전환은 오래된 아티팩트를 Coldline으로 이동하여 비용을 최적화하고, 버전 관리 및 보존 정책은 중요한 자산의 우발적 삭제를 방지합니다.
    • 단계: 객체 버전 관리를 활성화하고, 중요한 버킷에 30일 보존 정책을 설정하며, 중요하지 않은 빌드 아티팩트에 대해 90일 후 Coldline으로 전환하고 1년 후 삭제하는 수명 주기 규칙을 적용합니다.
  4. PD 스냅샷 예약 및 상태 저장 서비스를 위한 머신 이미지 생성

    • 근거: VM 디스크의 증분 스냅샷은 빠른 충돌 일관성 복원 옵션을 제공합니다. 머신 이미지는 부팅 및 구성을 캡처하여 리전 장애 조치 중 앱 서버의 재수화(rehydration)를 가속화합니다. 스냅샷 일정은 일관성 있고 정책 기반의 백업을 보장합니다.
    • 명령어: gcloud compute resource-policies create snapshot-schedule daily-2am –max-retention-days=14 –on-source-disk-delete=apply-retention-policy –start-time=02:00 gcloud compute disks add-resource-policies app-disk-1 –resource-policies=daily-2am gcloud compute machine-images create app-mi-2024-09-01 –source-instance=app-vm-template
  5. RTO/RPO 정의 및 DR 런북과 IaC 코드화

    • 근거: 웹/API에 대해 15분의 서비스 수준 RTO와 주문에 대해 4시간의 RPO를 설정합니다. 런북은 트래픽 장애 조치 절차, 읽기 복제본의 Cloud SQL 승격, DNS 비상 계획 및 검증 단계를 명시합니다. IaC(Terraform/Deployment Manager)는 결정론적 재구축을 보장하고 수동 오류를 줄입니다.
  6. 보조 리전에 용량 및 할당량 프로비저닝

    • 근거: 중요한 VM 형태에 대한 예약을 생성하고, 대기 로드 밸런서 백엔드, SSL 인증서, NAT 용량을 사전 프로비저닝하며, us-east1의 Compute, SQL, 전달 규칙 및 KMS에 대한 할당량을 확인합니다. 이는 장애 조치 중 용량 고갈을 방지합니다.
  7. 카오스 훈련을 통한 복구 검증 및 개선 사항 문서화

    • 근거: 분기별 영역 장애 훈련은 MIG 및 LB 동작을 검증하고, 반기별 리전 대피는 us-east1의 읽기 복제본을 승격시키고 글로벌 LB를 us-east1 백엔드로 지정하며 RTO/RPO를 측정합니다. 발견된 사항은 수동 단계를 줄이거나 복제본 용량을 늘리는 등의 개선을 이끌어냅니다.

이러한 단계를 따르면 Brightlane Retail은 자동화된 자가 복구 기능을 갖춘 영역 고가용성과 정의되고 테스트된 런북을 갖춘 리전 DR 태세를 달성하여, 주문 데이터가 4시간의 RPO를 충족하고 애플리케이션 서비스가 목표 RTO 범위 내에서 복구되도록 보장합니다.


보안 · 모든 도메인 · 비용 관리

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Google 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다