设计一个云原生历史数据处理系统:数据格式为 CSV、Avro、PDF;通过 Dataproc、BigQuery、Compute Engine 访问;每日批量摄取;性能不关键;最大化可用性。您应该如何存储数据?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将数据存储在多区域 Cloud Storage 存储桶中。使用 Dataproc、BigQuery 和 Compute Engine 直接访问数据。.
为什么这是答案
正确答案是多区域 Cloud Storage 存储桶。由于数据格式多样(CSV、Avro、PDF),且性能不是关键因素,Cloud Storage 提供了极高的灵活性,可以直接存储这些不同格式的数据。多区域存储桶能最大化可用性,符合题目要求。Dataproc、BigQuery 和 Compute Engine 都可以直接访问 Cloud Storage 中的数据,无需额外的数据移动或转换,简化了架构。 创建一个高可用性的 Dataproc 集群并将数据存储在 HDFS 中不合适,因为 HDFS 适用于集群内部存储,不便于 BigQuery 和 Compute Engine 直接访问,且无法满足最大化可用性的要求。将数据存储在 BigQuery 中不适合存储 PDF 等非结构化数据,且其主要用于分析,不适合作为原始数据湖。将数据存储在区域级 Cloud Storage 存储桶中虽然可行,但多区域存储桶能提供更高的可用性,更符合题目中“最大化可用性”的要求。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡