Google PDE: データストレージ、データレイク、ファイル形式 — 学習ガイド

こちらの一部です: Google Professional Data Engineer — 学習ガイド. 検証済みの解答で練習: Google試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

概要

Google Cloudでのデータストレージは、生のオブジェクトストレージ、キュレートされたデータレイク、分析に最適化されたフォーマットに及びます。信頼性、ガバナンス、パフォーマンスに優れたレイクを構築するには、ストレージクラス、バケット設定、ロケーション、ファイル形式、テーブルレイアウト、ライフサイクルを慎重に選択する必要があります。このセクションでは、設計上のトレードオフ、避けるべき障害モード、そして大規模なBigQuery、Spark、ストリーミングパイプラインと連携するパターンについて詳述します。

Cloud Storageの基礎:クラス、バケット、一貫性、ライフサイクル

Cloud Storageは、生ファイルおよびキュレート済みファイルのための、耐久性と可用性の高い基盤です。

BigLakeとDataplexによる統合されたレイクガバナンス

BigLakeとDataplexは、ファイルとテーブルにまたがるセキュリティとガバナンスを標準化します。

ファイルフォーマット、圧縮、クエリの動作

適切なフォーマットを選択することは、コストとパフォーマンスに直接的な影響を与えます。

レイアウト、パーティショニング、パフォーマンスエンジニアリング、レジデンシー、移行

undefined

実践的な問題シナリオ

Acme Retail は、物流パートナーからリージョナル Cloud Storage バケットに毎日 CSV ファイルを受け取っています。ファイルには時折、不正な形式の行が含まれています。Acme は、データを配置、検証し、分析に適した形式に変換して BigQuery にロードし、ほぼリアルタイムのダッシュボードで利用できるようにする必要があります。同時に、不正な行は検査用に保持し、ガバナンスを強制しなければなりません。

アプローチ:

  1. Dataplex で生データを配置し、ガバナンスを適用

    • gs://acme-raw/logistics/ にマッピングされた raw ゾーンアセットを持つ Dataplex lake を作成する。
    • 根拠: ガバナンス、メタデータ、リネージの一元管理。ゾーンレベルで IAM を強制し、機密フィールドにはダウンストリームでの強制適用のためのポリシー タグを付与する。
  2. ライフサイクルと保持ポリシーを適用

    • acme-raw に 30 日間のバケット保持ポリシーを適用し、オブジェクトのバージョニングを有効にする。
    • 根拠: パートナーによる偶発的な上書き/削除から保護する。短い保持期間は、コストと回復可能性のバランスを取る。バージョニングにより、不適切な配信のロールバックが容易になる。
  3. Dataflow バッチパイプラインで検証と取り込み

    • オブジェクトのファイナライズ通知をトリガーとして、毎日 Dataflow ジョブを実行する。スキーマとレコードごとの検証を用いて CSV を読み込む。有効なレコードは BigQuery のステージングテーブル (event_date でパーティション分割) に書き込み、パース/検証エラーはデッドレター用の BigQuery テーブルにルーティングする。
    • 根拠: Dataflow はスケーラブルな並列パースと堅牢なデッドレター処理を提供するため、アナリストは不正な行を検査できる。これは、品質が不均一な CSV に対するベストプラクティスを反映している。
  4. curated ゾーンで Parquet に変換・圧縮

    • 同じパイプラインが、検証済みのデータを gs://acme-curated/logistics/date=YYYY-MM-DD/ に、約 256~512 MB のサイズの Parquet ファイルとして書き込む。
    • 根拠: Parquet は BigQuery と Spark での列プルーニングと述語プッシュダウンを可能にし、スキャンされるバイト数を削減してレイテンシーを改善する。コンパクションは、パートナーの配信パターンに起因する小規模ファイルのオーバーヘッドを軽減する。
  5. BigLake を介してガバナンスの効いた分析を公開

    • curated Parquet パス上に、Hive の自動パーティショニングを使用した BigLake 外部テーブルを作成する。パートナー固有のフィルターのために、列レベルのポリシー タグと行アクセス ポリシーを適用する。
    • 根拠: BigQuery と Spark にわたる均一で詳細なアクセス制御と、一元化された監査を実現する。パーティションプルーニングにより、日付フィルターでのスキャンコストが削減される。
  6. 重要な集計をネイティブ BigQuery にロード

    • アクセスの多いダッシュボード向けに、curated Parquet 外部テーブルから過去 N 日分のデータを取り込み、ネイティブのクラスタ化・パーティション化されたテーブルに格納する BigQuery ジョブをスケジュール実行する。
    • 根拠: ネイティブストレージは高い同時実行性が求められる BI を高速化する一方、外部 BigLake テーブルはより広範なアクセスのためのガバナンスが適用された正系のシステムとして存続する。
  7. Cloud Logging と Pub/Sub で監視とアラート

    • Dataflow と BigQuery のロードジョブの結果をフィルタリングして Pub/Sub に送るログシンクを作成する。監視ツールと統合し、障害や不正な行の割合の上昇時に即時アラートを受け取る。
    • 根拠: ポーリングなしで、対象を絞ったテーブル固有の運用可視性を実現する。SRE プラクティスをサポートする。
  8. ストレージクラスとレジデンシーの最適化

    • curated Parquet は 14 日間 Standard に保持し、ライフサイクルルールにより 30 日後に Coldline に移行する。エグレスを避けるため、raw と curated の両方のバケットを BigQuery データセットと同じリージョンに保存する。
    • 根拠: アクセスの多いデータの読み取りパフォーマンスとコストのバランスを取る。併置により、コンプライアンスを維持し、レイテンシーとエグレス料金を最小限に抑える。
  9. エンドツーエンドの品質を検証

    • 各実行後、ステージング、curated 外部、ネイティブ BigQuery の各テーブル間で件数とハッシュ集計を比較し、異常があれば隔離する。
    • 根拠: スキーマのドリフトや取り込みのリグレッションを早期に検出する。暗号学的ハッシュまたはフィンガープリントハッシュは、完全な再スキャンなしで軽量な保証を提供する。

この設計は、デッドレター分析を備えた回復力のある取り込み、効率的なクエリのための分析対応 Parquet、Dataplex と BigLake による一元化されたガバナンス、そしてコスト最適化されたライフサイクルポリシーを提供します。これらすべては、最小権限アクセスと監査可能なオペレーションの原則を遵守しながら実現されます。


データエンジニアリングのアーキテクチャと設計 · すべてのドメイン · BigQuery による分析とウェアハウスエンジニアリング

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Googleを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能