GoogleGoogle Professional Data Engineer (PDE) Certification
·CN
·更新于 21 Aug 2026
您有本地 Spark 作业每天处理 Parquet 文件。迁移到 Google Cloud 后,您希望使用托管服务,最大限度地减少 ETL 更改,并为未来的管道提供 BigQuery 可用性。您应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将数据迁移到 Cloud Storage,并将元数据迁移到 Dataproc Metastore (DPMS)。重构 Spark 作业以读写 Cloud Storage,并在 Dataproc Serverless 上运行它们。.
为什么这是答案
正确答案是最佳选择,因为它利用了Dataproc Serverless进行托管Spark作业,最大限度地减少了ETL更改,并提供了BigQuery可用性。将数据迁移到Cloud Storage是处理Parquet文件的标准做法,而Dataproc Metastore (DPMS) 提供了一个兼容Hive的元数据存储,便于现有Spark作业的迁移。Dataproc Serverless消除了集群管理开销,与现有Spark作业高度兼容。
将存储桶注册为Dataplex资产虽然有助于数据治理,但并非迁移Spark作业的必要步骤。将数据迁移到BigQuery需要对Spark作业进行重大重构,以适应BigQuery的读写模式,这与“最大限度地减少ETL更改”的目标相悖。在Compute Engine上运行Dataproc会增加集群管理负担,而Dataproc Serverless是更现代、更高效的选择。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡