Google PCNE: 네트워크 관측성, 안정성 및 문제 해결 — 학습 가이드
다음의 일부입니다: Google Professional Cloud Network Engineer — 학습 가이드. 검증된 답안으로 연습하기: Google 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.
개요
Google Cloud의 네트워크 관측성(observability)은 VPC, 부하 분산기, 하이브리드 연결, 서비스 전반의 도달 가능성, 성능, 정확성을 설명하는 네트워크 신호를 체계적으로 수집, 상호 연관 분석, 분석하는 것입니다. 안정성은 장애 감지 및 안전한 해결을 위한 설계에서 비롯됩니다. 즉, 최상급 원격 분석(telemetry)을 계측하고, 데이터 영역(data plane)을 건드리기 전에 제어 영역(control plane)을 검증하며, 필요할 때만 패킷 증거로 심층 분석하고, 롤백을 자동화하는 것입니다. 이 섹션에서는 Google Cloud 도구와 패턴을 사용하여 변경 중 위험을 최소화하면서 문제를 감지, 진단, 예방하는 방법을 설명합니다.
플로우 로그, 로깅, 모니터링, 측정항목, SLO
VPC Flow Logs는 VPC 방화벽 평가 후 VM NIC에서 샘플링되고 집계된 원격 분석 데이터를 제공합니다. 이는 전체 패킷 캡처가 아니며, 명시적인 허용/거부 증거를 위한 방화벽 규칙 로깅을 대체하지 않습니다. 주요 제어 항목:
- 샘플링: 0.0–1.0. 샘플링 비율이 높을수록 로그 볼륨과 잠재적 비용이 증가하지만 충실도가 향상됩니다.
- 집계 간격: 5초–30분. 간격이 짧을수록 감지 시간은 줄어들지만 항목 수가 증가합니다.
- 메타데이터: 인스턴스 및 VPC 메타데이터를 포함하거나 제외합니다. 더 풍부한 분석을 위해 포함하고, 민감한 속성을 제한하려면 제외합니다.
서브넷에서 일반적인 활성화 방법:
undefined
영구적인 분석 및 프로젝트 간 공유를 위해 로그 싱크로 내보내기:
- SQL 분석 및 장기 추세 분석을 위한 BigQuery.
- SIEM/IDS로의 거의 실시간 파이프라인을 위한 Pub/Sub.
- 보관을 위한 Cloud Storage.
BigQuery로의 싱크 예시:
undefined
방화벽 규칙 로깅은 허용/거부 결정과 일치하는 규칙을 기록하여 플로우 로그를 보완합니다. 차단된 트래픽을 관찰하려면 규칙 세트의 맨 아래 근처에 로깅이 활성화된 전체 거부(deny-all) 규칙을 추가하십시오.
undefined
Cloud Logging을 사용하면 구조화된 쿼리, 요청 로그, 상태 확인 로그, NAT 로그, 부하 분산기 로그와의 상호 연관 분석이 가능합니다. 다음과 같은 신호를 위해 로그 기반 측정항목을 생성하십시오.
- 백엔드 태그에 대한 거부된 연결의 급증(허용 목록의 잘못된 구성 가능성).
- 특정 포트로의 대량 SYN 재전송(포화 또는 블랙홀링 가능성).
- NAT ‘사용 가능한 포트 없음’ 이벤트(Cloud NAT 고갈).
Cloud Monitoring은 측정항목을 집계하고 대시보드, 알림, SLO를 제공합니다.
- 주시해야 할 측정항목: 부하 분산기 5xx 비율, 백엔드 지연 시간, 인스턴스 NIC 바이트/패킷, Cloud NAT 할당/사용/오버플로우 포트, Cloud Router BGP 세션 상태, VPN 터널 패킷 드롭, Interconnect 링크 사용률, 패킷 손실 및 지연 시간.
- 대시보드: 일관된 운영을 위해 프로젝트 간에 공유 템플릿을 사용하여 서비스별 및 연결별 대시보드를 구축합니다.
- 알림: 빠른 피드백을 제공하는 증상 기반 알림(오류율, 지연 시간, 드롭 카운터)을 선호하고, 사용자 영향이 예상될 때 페이징을 동반하는 원인 기반 알림(BGP 플랩, 링크 다운)을 사용합니다.
- SLO: 사용자 중심의 SLO(예: 전역 HTTP 성공률 및 지연 시간)를 정의하고, 소진율(burn-rate) 알림을 사용하여 빠르거나 느린 소진을 식별합니다. 정확한 SLO 평가를 위해 로그 기반 측정항목을 통해 요청 로그를 분자/분모로 사용합니다.
장단점 및 장애 모드:
- 샘플링 비율이 낮거나 집계 간격이 길면 마이크로버스트 및 단기 장애가 숨겨질 수 있습니다.
- 플로우 로그는 방화벽 이전의 드롭에 대한 가시성이 부족하므로, 거부 증거는 방화벽 규칙 로깅에 의존해야 합니다.
- 필터링 없는 과도한 로깅은 비용을 증가시키고 조사 속도를 늦출 수 있습니다. 데이터를 현명하게 내보내고 파티셔닝하십시오.
Network Intelligence Center 및 고급 진단
Network Intelligence Center(NIC)는 사전 예방적이고 구조화된 진단을 제공합니다.
Connectivity Tests:
- 경로, 방화벽 규칙(계층적 정책 포함), 서비스 계정/태그, 부하 분산기, Cloud NAT, 하이브리드 연결 전반에 걸쳐 제어 영역(control-plane)의 도달 가능성을 검증합니다.
- 경로 진단은 선택된 다음 홉(next hop)을 계산하고 누락된 경로 또는 비대칭 경로와 같은 잘못된 구성을 보고합니다.
- 네트워크 변경 전후에 사용하여 의도하지 않은 영향 반경(blast radius)을 감지합니다. 이는 제어 영역을 모델링하며 데이터 영역(data-plane)의 품질을 보장하지 않으므로 패킷/측정항목 증거와 함께 사용해야 합니다.
Performance Dashboard:
- 리전 간 및 인터넷 관측 지점까지의 패킷 손실 및 지연 시간에 대한 Google 관리형 뷰입니다. 서비스 로컬 문제와 대비하여 거시적 이벤트(리전 또는 경로 전반의 혼잡)를 감지하는 데 유용합니다.
Network Topology:
- 프로젝트 간, VPC 간, 하이브리드 연결 및 트래픽 볼륨(로그 활용)을 시각화하여 핫스팟, 예기치 않은 피어링 경로, 의도하지 않았을 수 있는 전이적(transitive) 동작을 식별합니다.
Firewall Insights:
- 가려진(shadowed) 규칙, 사용되지 않는 허용 규칙, 지나치게 허용적인 소스, 대상 태그/서비스 계정이 누락된 규칙을 감지합니다. 알려진 흐름을 중단시키지 않으면서 공격 표면을 줄이기 위해 더 엄격한 규칙을 권장합니다.
Network Analyzer:
- 프로젝트 전반에 걸친 정적 및 동적 구성 검사를 통해 다음과 같은 상황을 파악합니다.
- 방화벽에 의해 차단된 상태 확인(Google 상태 확인 소스 IP 범위를 허용해야 함을 기억하십시오).
- 잘못된 리전에 있거나 명명된 포트가 누락된 부하 분산기 백엔드.
- 비공개 Google 액세스가 비활성화되어 외부 IP가 없는 인스턴스의 API 액세스를 차단하는 서브넷.
- 중요한 프리픽스를 블랙홀링하거나 VPN/Interconnect 전반에 비대칭 라우팅을 유발하는 경로.
운영 가이드:
- 네트워크 변경을 위한 CI/CD에 NIC 검사를 포함하고 정기적으로 실행하십시오. 발견된 사항을 안정성 부채로 취급하고 위험 감소 효과에 따라 수정의 우선순위를 정하십시오.
패킷 미러링, 부하 분산기, 하이브리드 원격 측정
패킷 미러링:
- VM 트래픽을 수집기(어플라이언스 또는 관리형 IDS)로 미러링하여 심층 분석을 수행합니다. 서브넷, 네트워크 태그 또는 서비스 계정으로 범위를 지정하고, 비용을 제어하기 위해 필요한 프로토콜로 제한합니다.
- 오버헤드 및 절충점: 미러링된 트래픽 이그레스(egress)에는 비용이 발생하며, 과도한 미러링은 수집기에 부담을 줄 수 있습니다. 프로덕션 환경에서 무분별하게 미러링하지 마십시오. 인시던트 발생 시에는 시간 제한이 있고 범위가 좁은 세션을 사용합니다.
- IDS 통합:
- Cloud IDS는 Packet Mirroring을 활용하여 관리형 OOB(out-of-band) 위협 탐지를 제공합니다. 신속한 활성화와 유지보수 감소를 위해 이 방법을 사용하는 것이 좋습니다.
- 특정 시그니처나 벤더 생태계가 필요한 경우 서드파티 IDS 어플라이언스도 여전히 유효한 선택지입니다.
부하 분산기 로그 및 상태 확인 증거:
- HTTP(S) 부하 분산기 요청 로그에는 메서드, URL, 백엔드, 응답 코드, 지연 시간 및 X-Forwarded-For를 통한 클라이언트 IP가 포함됩니다. traceroute는 Google Front End(GFE)에서 중단되므로 클라이언트 경로 분석에 이 로그를 사용합니다.
- 백엔드 서비스에서 로깅을 활성화하고 샘플링을 구성하여 비용과 가시성 간의 균형을 맞춥니다. 상태 확인 로깅을 켜서 프로브 결과와 실패 원인을 확인합니다.
- 클라이언트 액세스 제한: 인스턴스에 태그를 지정하고 승인된 클라이언트 범위와 Google 상태 확인 IP만 허용하는 방화벽 규칙을 생성하여 백엔드에서 액세스를 강제합니다. L7 위협 완화 및 점진적 배포를 위해서는 적용하기 전에 미리보기 모드에서 Cloud Armor 규칙을 사용합니다.
VPN 및 Interconnect 원격 측정:
- Cloud VPN (HA VPN) 측정항목: 바이트, 드롭, 암호화 오류, 터널 가동 시간, BGP 세션 상태. 패킷 드롭, 빈번한 DPD 이벤트, BGP 플랩(flap) 발생 시 알림을 설정합니다.
- 처리량 확장: 고유한 피어 IP에 터널을 추가하고 트래픽을 분산시킵니다. 헤드룸을 모니터링합니다. Cloud Router 간에 활성/대기 구성이 필요한 경우, 온프레미스 MED 속성을 사용하여 경로 선택에 편향을 주는 것이 좋습니다.
- Interconnect 측정항목: 링크별 사용률, CRC 오류, 가용성. 60–70%를 초과하는 지속적인 사용률과 오류 급증을 주시합니다. 예비 용량과 다양한 회선을 유지합니다. 재전송 및 큐잉 지표를 통해 지연 시간 증가를 조사합니다.
- 엣지 전반의 포화 신호: TCP 재전송 증가, 코드 변경 없는 99번째 백분위수 지연 시간 증가, NAT 포트 오버플로 이벤트, 큐 점유율 알림 등은 임박한 영향에 대한 조기 경고입니다.
문제 해결 방법론, 인시던트 처리 및 사전 예방적 안정성
DNS부터 앱까지의 구조화된 문제 해결:
- 실패하는 사용자 여정과 시간대를 식별하고, 리전 및 경로(LB를 통한 퍼블릭, VPC를 통한 프라이빗 또는 하이브리드)를 특정합니다.
- DNS:
- Cloud DNS 로그, dig 출력, 정책 동작으로 이름 확인(resolution)을 검증합니다. 스플릿 호라이즌(split-horizon) 충돌을 확인하고 전달 정책이 적용되고 있는지 확인합니다.
- TTL과 최근 변경 사항을 확인합니다. 오래된 캐시는 장애처럼 보일 수 있습니다.
- 부하 분산기 및 엣지:
- 요청 및 상태 확인 로그를 검토합니다. 5xx 급증을 백엔드 상태 및 배포 이벤트와 연관시킵니다. L7의 경우 traceroute보다 요청 로그를 신뢰합니다.
- 액세스가 제한된 경우 방화벽 규칙에서 클라이언트 허용 목록과 Google 상태 확인 IP를 확인합니다.
- 라우팅 및 방화벽:
- 결정론적인 제어 영역(control-plane) 평가를 위해 Connectivity Tests를 사용합니다. 유효 경로와 계층적 방화벽 정책을 검사합니다. 비대칭 라우팅과 가려진 규칙(shadowed rules)을 찾습니다.
- 거부된 패킷에 대해서는 방화벽 규칙 로깅에 의존합니다. 조사 중에는 우선순위 스택의 맨 아래 근처에 로깅되는 전체 거부(deny-all) 규칙을 추가하는 것을 고려합니다.
- Google API로의 이그레스(Egress):
- 인스턴스에 외부 IP가 없는 경우 Private Google Access 및/또는 Cloud NAT를 확인합니다. 둘 중 하나라도 없으면 간헐적인 실패와 혼란스러운 타임아웃이 발생합니다.
- 하이브리드:
- Cloud Router 및 VPN/Interconnect 측정항목을 검사합니다. BGP는 활성 상태이지만 경로가 설치되지 않은 것은 속성 선호도를 반영할 수 있습니다. MED/local-pref 및 ASN을 확인합니다. 패킷 손실 및 경로 MTU 문제를 주시합니다.
- 패킷 증거:
- 제어 영역은 정상으로 보이지만 증상이 지속되면, 영향을 받는 VM 또는 티어 근처에서 PCAP을 수집하기 위해 Packet Mirroring을 제한적으로 사용합니다. MTU 블랙홀을 찾기 위해 SYN/SYN-ACK 타이밍, 재전송, MSS/DF 비트를 확인합니다.
인시던트 처리:
- 변경 안전성: 태그/서비스 계정으로 범위 지정, 낮은 우선순위, 비활성화된 규칙을 사용하여 변경을 단계적으로 적용합니다. 로깅을 활성화하고 카나리(canary)로 테스트합니다. L7 정책 변경에는 Cloud Armor 미리보기(preview)를 사용합니다.
- 롤백: 역변경(inverse changes)을 미리 정의하고, 이전 구성을 버전 제어 시스템에 보관하며, 해당하는 경우 앱 엣지에서 수명이 짧은 기능 플래그를 사용합니다.
- 사후 분석: 로그와 측정항목으로 타임라인을 구성하고, 기여 요인(예: 거부 규칙에 가려진 허용 규칙, NAT 고갈)을 분류하고, 탐지 격차를 기록하며, 알림, NIC 확인, 정책 강화와 같은 안전장치를 추가합니다.
용량 계획 및 사전 예방적 안정성:
- 여유 공간 목표 추적: VPN/Interconnect 링크에서 30–50%, NAT 포트 사용률 60% 미만 유지, LB 백엔드 CPU 및 QPS가 자동 확장 트리거보다 훨씬 낮게 유지.
- 주요 위험에 대한 로그 기반 측정항목 구축: 거부 급증, NAT 오버플로, BGP 플랩 횟수, 5xx 비율, LB 백엔드 연결 오류. 다중 기간 소진율(multi-window burn-rate) 알림을 사용하여 빠르고 느린 인시던트를 모두 감지합니다.
- 합성 모니터링: 퍼블릭 엔드포인트에는 여러 리전의 Uptime Checks를 사용하고, 내부 서비스에는 테스트 VM의 프라이빗 프로브를 사용합니다.
- 예방적 개선: Firewall Insights를 사용하여 방화벽 규칙을 구체화하고, Network Analyzer 결과를 해결하며, 피크 이벤트 동안 Flow Log 집계 간격을 줄이고, 반복적인 이상 감지를 위해 로그를 BigQuery로 내보냅니다.
실용적인 문제 시나리오
Contoso Games는 us-east1 및 europe-west1에서 전역 HTTP(S) 부하 분산 게임 API를 운영하며, 온프레미스 데이터 센터와 HA VPN으로 연결되어 있습니다. 유럽 사용자들이 최근 방화벽 변경 후 간헐적인 타임아웃과 더 높은 지연 시간을 보고합니다. 인스턴스에는 외부 IP가 없으며 Google API에 비공개로 연결해야 합니다.
접근 방식:
- 시간대 및 SLO 영향 설정
- 근거: 시간대를 특정하면 쿼리를 관련 로그로 제한하고 조사를 사용자에게 영향을 미치는 SLO에 맞출 수 있습니다. 소진율(burn-rate) 알림은 europe-west1에서 빠른 SLO 소진을 확인해 줍니다.
- Connectivity Tests로 제어 영역 검증
- 근거: 외부 HTTP(S) 부하 분산기 프런트엔드에서 europe-west1 백엔드 서비스로, 그리고 영향을 받는 VM에서 Private Google Access VIP로 테스트를 생성합니다. 이 테스트는 일부 백엔드로의 상태 확인을 차단하는 계층적 방화벽 정책과 한 서브넷에 대한 Private Google Access 누락을 표시합니다.
- 로그를 통해 엣지 및 백엔드 상태 확인
- 근거: europe-west1에 대한 부하 분산기 요청 로그를 response_code >= 500으로 필터링하여 백엔드 오류를 분리합니다. 상태 확인 로그는 알려진 Google 상태 확인 소스 IP로부터의 프로브 실패를 보여줍니다. 이는 애플리케이션 회귀가 아닌 방화벽으로 인한 백엔드 플래핑(flapping)의 증거입니다.
- 범위가 지정된 변경으로 상태를 복원하고 안전성 보호
- 근거: 상태 확인 소스 범위를 허용하는 백엔드 태그를 대상으로 하는 허용 규칙을 추가합니다. 이 규칙에 로깅을 활성화합니다. 액세스가 알려진 클라이언트로 제한되므로, 허용 목록 방화벽 규칙에 특정 클라이언트 IP 범위와 상태 확인 범위만 포함되어 있는지 확인합니다. 새 규칙을 처음에는 비활성화 상태로 유지한 다음, 트래픽이 적은 카나리(canary) 중에 활성화하여 영향 반경(blast radius)을 제한합니다.
- Google API로의 비공개 이그레스 재설정
- 근거: 영향을 받는 서브넷에서 Private Google Access를 활성화하여 외부 IP가 없는 인스턴스가 VPN이나 타사 방화벽을 통한 헤어피닝(hairpinning) 없이 Google 서비스에 도달하도록 합니다. 이는 지연 시간을 줄이고 병목 지점을 제거합니다.
- 하이브리드 포화 상태 및 MTU 확인
- 근거: HA VPN 측정항목에서 패킷 손실 및 사용률을 검토합니다. 한 터널에서 높은 손실이 나타납니다. 다른 온프레미스 피어 IP로 두 번째 터널을 추가하고 트래픽을 분산하여 용량을 늘립니다. VPN 경로에서 PMTU 블랙홀을 방지하기 위해 유효 MTU 및 MSS 클램프를 확인합니다.
- 의심스러운 악의적인 클라이언트에 대해 Cloud Armor 미리보기 사용
- 근거: 요청 로그에서 소수의 클라이언트 IP 집합이 프로브 실패 직전에 트래픽을 급증시킵니다. Cloud Armor에 미리보기 모드로 거부 규칙을 추가하여, 규칙을 적용하기 전에 차단이 백엔드 부하를 줄일 수 있는지 검증하고 의도치 않은 사용자 영향을 방지합니다.
- 데이터 영역 동작을 확인하기 위해 Packet Mirroring을 제한적으로 사용
- 근거: 비정상적인 단일 백엔드 VM의 트래픽을 15분 동안 Cloud IDS로 미러링합니다. PCAP은 악의적인 IP로부터의 버스트(bursts) 동안 SYN 백로그 고갈을 보여주며, 이는 Cloud Armor 정책의 유용성과 비율 제한(rate limiting)의 필요성을 뒷받침합니다.
- 인시던트 종료 및 시스템 강화
- 근거: 상태 확인 허용 규칙을 활성화하고, Private Google Access를 확인하고, VPN 용량을 확장하고, 검증된 Cloud Armor 규칙을 적용한 후 오류율이 기준선으로 돌아옵니다. 상태 확인 성공률, NAT 포트 사용량, VPN 손실, 리전별 5xx에 대한 대시보드를 추가합니다. 백엔드 태그에 대한 방화벽 거부 및 SLO 소진율(burn-rate)에 대한 로그 기반 알림을 생성합니다. 인시던트, 근본 원인(계층적 방화벽 변경, 악의적인 트래픽, VPN 포화 상태)을 기록하고, 변경 전 체크리스트에 NIC Analyzer 및 Firewall Insights 확인을 추가합니다.
이 순서는 안전하고 증거에 기반한 워크플로를 보여줍니다: 제어 영역을 확인하고, 데이터 영역을 관찰하며, 최소한의 가역적인 변경을 적용한 다음, 알림 및 자동화된 검사를 통해 학습한 내용을 시스템에 반영합니다.
이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
시험 합격하기 →