GoogleGoogle Professional Data Engineer (PDE) Certification
·CN
·更新于 21 Aug 2026
您希望使用无服务器、基于 SQL 的方法重建一个缓慢的 PySpark 批处理管道。原始数据存储在 Cloud Storage 中。您应该如何实现该管道以加快开发和运行时速度?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将数据从 Cloud Storage 加载到 BigQuery 中,将 PySpark 转换翻译为 BigQuery SQL,并将结果写入新的 BigQuery 表。.
为什么这是答案
此选项通过将数据加载到 BigQuery 并使用 BigQuery SQL 进行转换,实现了无服务器、基于 SQL 的方法,并能显著提高开发和运行时速度。BigQuery 是一种高度可扩展的无服务器数据仓库,专为快速分析而设计。将 PySpark 转换翻译为 BigQuery SQL 可以利用 BigQuery 的优化查询引擎,从而加快处理速度。将结果写入新的 BigQuery 表也符合最佳实践。
其他选项的不足之处在于:
在 Dataproc 上运行 SparkSQL 仍然涉及集群管理,不完全是无服务器的。
将数据摄取到 Cloud SQL 会引入额外的复杂性和潜在的性能瓶颈,并且不完全利用 BigQuery 的无服务器特性。
使用 Apache Beam Python SDK 重新实现转换虽然是无服务器的,但涉及代码重写,可能不如直接将 PySpark 逻辑转换为 BigQuery SQL 来得快,并且不完全是基于 SQL 的方法。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡