Google Professional Data Engineer — 学习指南
边学边练。 每个概念都对应 Google 考试中心中带有验证答案的真实考题,或在 ExamRoll.io 上通过限时练习演练整场考试。
本指南深入讲解每个 PDE 领域。选择一个领域深入学习,或按顺序逐一学习。
领域
- 数据工程架构与设计 — Google Cloud 上的数据工程架构与设计需要在领域边界、处理模式和服务能力之间取得平衡,以交付可靠、可扩展且经济高效的数据平台。有效的设计能使存储、计算、编排和服务层可以独立扩展;将契约代码化以实现领域间的互操作;并通过可衡量的服务水平目标 (SLO)
- 数据存储、数据湖与文件格式 — Google Cloud 上的数据存储涵盖了原始对象存储、精选数据湖以及为分析优化的格式。要构建可靠、受治理且高性能的数据湖,需要在存储类别、存储桶设置、位置、文件格式、表布局和生命周期方面做出审慎的选择。本节详细介绍了设计上的权衡、需要避免的故障模式,以及与大规模 BigQuery、Spark
- BigQuery 分析与数仓工程 — BigQuery 是一个无服务器、列式、MPP(大规模并行处理)的分析型仓库,它将存储与计算分离,提供了近乎无限的扩展能力、ANSI SQL 和集成式治理。BigQuery 上的仓库工程需要在模式设计(分区、聚类、反规范化与规范化、嵌套记录)、注入模式(批量加载、流式注入、Storage
- 使用 Dataflow 和 Apache Beam 进行流处理 — Google Cloud 上的流处理以 Apache Beam 的统一编程模型为核心,并由 Dataflow runner 执行。Beam 提供了一个逻辑抽象——对 PCollection 应用一系列转换 (transform) 的流水线
- 消息传递、事件注入与实时服务 — Google Cloud 上的消息传递、事件注入和实时服务以 Cloud Pub/Sub 和 Eventarc 为核心,提供解耦、持久化的传输;以 Dataflow 提供有状态的流处理;并以 BigQuery、Cloud Storage 和各种运维型数据库作为数据汇 (sink)。通过为至少一次
- Spark、Dataproc 与分布式数据处理 — Google Cloud Dataproc 上的 Apache Spark 为分布式数据处理提供了一个托管的弹性平台。您可以根据控制需求、运行时可变性和管理开销,在长期运行的或临时性的 Dataproc 集群与 Dataproc Serverless for Spark 之间进行选择。Spark
- 数据注入、集成与迁移 — Google Cloud 中的数据注入、集成和迁移涵盖了多种可重复的模式、托管服务和运维控制,可将各种源系统转变为可靠、可查询的数据集。有效的设计应将传输与转换分离,解耦生产者和消费者,并倾向于采用具有清晰沿袭和验证机制的、幂等的、带检查点的流水线。本节内容涵盖注入模式、用于数据移动和 CDC 的
- 工作流编排与流水线自动化 — 关键选择: - 使用 Cloud Composer (Apache Airflow) 进行以代码为中心的批处理编排,适用于 DAG、任务依赖和高级调度。 - 使用 Cloud Workflows 进行无服务器 API 协同,适用于轻量级、事件驱动的跨服务序列。 - 使用 Cloud Run 作业或
- 机器学习、AI 与数据服务 — - 模型创建:使用 CREATE MODEL,明确指定标签列和特征转换,以避免数据泄露并标准化输入。 示例: CREATE OR REPLACE MODEL ds.churn_model OPTIONS( model_type=‘logistic_reg’,
- 数据治理、安全性、可靠性与成本运营 — 本节总结了在 Google Cloud 上进行数据治理、安全、可靠性和成本运营的设计模式与操作实践。重点关注 BigQuery、Cloud Storage、Dataflow、Dataplex 及相关支持服务。强调了最小权限、加密密钥管理、元数据与分类、策略驱动的访问、合规性证据、具有可操作 SLO
准备好练习了吗?
- 浏览所有带验证答案的题目 → — 免费,含解析。
- 在 ExamRoll.io 上开始限时模拟考试 → — 完整题库,支持 20 多种语言。
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →