您需要一个经济高效的分析环境,以便数据科学家可以使用 SQL 查询具有 Hive 样式分区的 ORC 文件,而不会影响本地 Hive。您应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将 ORC 文件复制到 Cloud Storage,然后为数据科学家团队创建外部 BigQuery 表。.
为什么这是答案
正确答案是“将 ORC 文件复制到 Cloud Storage,然后为数据科学家团队创建外部 BigQuery 表”。这种方法经济高效,因为数据存储在 Cloud Storage 中,而 BigQuery 仅在查询时收费。外部表允许数据科学家使用 SQL 直接查询 Cloud Storage 中的 ORC 文件,而无需将数据导入 BigQuery,从而避免了数据重复和额外的存储成本。Hive 样式分区在 Cloud Storage 中得到支持,并且 BigQuery 可以识别这些分区,从而实现高效的查询剪枝。 将 ORC 文件导入 Bigtable 不适合分析查询,因为 Bigtable 是一个 NoSQL 数据库,主要用于低延迟的键值查找,而不是复杂的 SQL 分析。将 ORC 文件导入 BigQuery 表会产生额外的数据导入和存储成本,并且可能导致数据重复,不如外部表经济高效。部署 Dataproc 集群虽然可以查询 ORC 文件,但会增加管理开销和持续的计算成本,不如 BigQuery 外部表那样无服务器且经济。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡