Google PDE: 데이터 스토리지, 레이크 및 파일 형식 — 학습 가이드

다음의 일부입니다: Google Professional Data Engineer — 학습 가이드. 검증된 답안으로 연습하기: Google 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

개요

Google Cloud의 데이터 스토리지는 원시 객체 스토리지, 큐레이션된 데이터 레이크, 분석에 최적화된 형식을 아우릅니다. 신뢰할 수 있고, 거버넌스가 적용되며, 성능이 뛰어난 레이크를 구축하려면 스토리지 클래스, 버킷 설정, 위치, 파일 형식, 테이블 레이아웃 및 수명 주기를 신중하게 선택해야 합니다. 이 섹션에서는 설계상의 장단점, 피해야 할 장애 모드, 그리고 대규모 BigQuery, Spark, 스트리밍 파이프라인과 부합하는 패턴에 대해 자세히 설명합니다.

Cloud Storage 기본: 클래스, 버킷, 일관성 및 수명 주기

Cloud Storage는 원시 파일과 큐레이션된 파일을 위한 내구성 있고 가용성이 높은 기반입니다.

BigLake와 Dataplex를 사용한 통합 레이크 거버넌스

BigLake와 Dataplex는 파일과 테이블 전반에 걸쳐 보안 및 거버넌스를 표준화합니다.

파일 형식, 압축 및 쿼리 동작

올바른 형식을 선택하는 것은 비용과 성능에 결정적인 영향을 미칩니다.

레이아웃, 파티셔닝, 성능 엔지니어링, 상주 위치 및 마이그레이션

undefined

실제 문제 시나리오

Acme Retail은 물류 파트너로부터 지역 Cloud Storage 버킷으로 매일 CSV 파일을 받습니다. 파일에는 가끔 형식이 잘못된 행이 포함되어 있습니다. Acme는 데이터를 저장, 검증하고, 분석에 적합한 형식으로 변환한 후, 거의 실시간 대시보드를 위해 BigQuery에 로드해야 하며, 동시에 잘못된 행은 검사를 위해 보관하고 거버넌스를 적용해야 합니다.

접근 방식:

  1. Dataplex에서 원시 데이터 저장 및 거버넌스 적용

    • gs://acme-raw/logistics/에 매핑된 원시 영역(raw zone) 애셋으로 Dataplex 레이크를 생성합니다.
    • 근거: 중앙 집중식 거버넌스, 메타데이터 및 리니지. 영역 수준에서 IAM을 적용하고 민감한 필드에 정책 태그를 지정하여 다운스트림에서 적용합니다.
  2. 수명 주기 및 보관 정책 적용

    • acme-raw에 30일 버킷 보관 정책을 적용하고 객체 버전 관리를 활성화합니다.
    • 근거: 파트너의 실수로 인한 덮어쓰기/삭제로부터 보호합니다. 짧은 보관 기간은 비용과 복구 가능성의 균형을 맞춥니다. 버전 관리는 잘못된 전송의 롤백을 용이하게 합니다.
  3. Dataflow 배치 파이프라인으로 검증 및 수집

    • 객체 완료 알림 시 매일 Dataflow 작업을 트리거합니다. 스키마 및 레코드별 검증으로 CSV를 읽고, 유효한 레코드는 BigQuery 스테이징(event_date로 파티셔닝)에 쓰고, 파싱/검증 오류는 데드 레터 BigQuery 테이블로 라우팅합니다.
    • 근거: Dataflow는 확장 가능한 병렬 파싱과 강력한 데드 레터 처리를 제공하여 분석가가 잘못된 행을 검사할 수 있도록 합니다. 이는 이기종 CSV 품질에 대한 모범 사례를 반영합니다.
  4. 큐레이션된 영역에서 Parquet으로 압축 및 변환

    • 동일한 파이프라인이 검증된 데이터를 gs://acme-curated/logistics/date=YYYY-MM-DD/ 경로에 약 256–512MB 크기의 Parquet 파일로 씁니다.
    • 근거: Parquet은 BigQuery 및 Spark에서 열 프루닝 및 조건자 푸시다운을 가능하게 하여 스캔되는 바이트를 줄이고 지연 시간을 개선합니다. 압축은 파트너의 전송 패턴으로 인한 작은 파일 오버헤드를 완화합니다.
  5. BigLake를 통해 거버넌스가 적용된 분석 노출

    • 큐레이션된 Parquet 경로 위에 Hive 자동 파티셔닝을 사용하여 BigLake 외부 테이블을 생성하고, 파트너별 필터를 위해 열 수준 정책 태그 및 행 액세스 정책을 적용합니다.
    • 근거: 중앙 집중식 감사를 통해 BigQuery 및 Spark 전반에 걸쳐 균일하고 세분화된 액세스를 제공합니다. 파티션 프루닝은 날짜 필터에 대한 스캔 비용을 줄입니다.
  6. 중요한 집계를 네이티브 BigQuery에 로드

    • 사용량이 많은 대시보드를 위해, 큐레이션된 Parquet 외부 테이블에서 최근 N일간의 데이터를 네이티브 클러스터링, 파티셔닝된 테이블로 수집하는 예약된 BigQuery 작업을 실행합니다.
    • 근거: 네이티브 스토리지는 동시성이 높은 BI를 가속화하는 반면, 외부 BigLake 테이블은 더 넓은 액세스를 위한 거버넌스가 적용된 기록 시스템(system-of-record)으로 유지됩니다.
  7. Cloud Logging 및 Pub/Sub으로 모니터링 및 알림

    • Dataflow 및 BigQuery 로드 작업 결과를 Pub/Sub으로 필터링하는 로그 싱크를 생성하고, 모니터링 도구와 통합하여 실패 또는 비정상 행 비율 증가 시 즉시 알림을 받습니다.
    • 근거: 폴링 없이 대상 테이블별 운영 가시성을 확보하고 SRE 관행을 지원합니다.
  8. 스토리지 클래스 및 상주 위치 최적화

    • 큐레이션된 Parquet을 14일간 Standard에 보관하고, 수명 주기 규칙을 통해 30일 후 Coldline으로 전환합니다. 원시 버킷과 큐레이션된 버킷 모두 이그레스를 피하기 위해 BigQuery 데이터 세트와 동일한 리전에 저장합니다.
    • 근거: 핫 리드 성능과 비용의 균형을 맞춥니다. 동일 위치 배치는 규정 준수를 유지하고 지연 시간 및 이그레스 요금을 최소화합니다.
  9. 엔드투엔드 품질 검증

    • 각 실행 후 스테이징, 큐레이션된 외부 테이블, 네이티브 BigQuery 테이블 간의 개수 및 해시 집계를 비교하고, 이상 징후를 격리합니다.
    • 근거: 스키마 드리프트 또는 수집 회귀를 조기에 감지합니다. 암호화 또는 지문 해시는 전체 재스캔 없이 가벼운 보증을 제공합니다.

이 설계는 데드 레터 분석을 통한 복원력 있는 수집, 효율적인 쿼리를 위한 분석 준비된 Parquet, Dataplex 및 BigLake를 통한 중앙 집중식 거버넌스, 비용 최적화된 수명 주기 정책을 제공하며, 동시에 최소 권한 액세스 및 감사 가능한 운영 원칙을 준수합니다.


데이터 엔지니어링 아키텍처 및 설계 · 모든 도메인 · BigQuery 분석 및 웨어하우스 엔지니어링

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Google 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다