一个位于 europe-west4 区域的 Dataflow 流水线,最多有 3 个 n1-standard-1 worker,从 Pub/Sub 读取数据并写入 BigQuery EU。该流水线在高峰期受 CPU 限制。以下哪两项更改可以提高流水线吞吐量?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 增加 worker 的最大数量。, 为 Dataflow worker 使用更大的机器类型。.
为什么这是答案
当 Dataflow 流水线在高峰期受 CPU 限制时,增加计算资源是提高吞吐量的直接方法。 1. 增加 worker 的最大数量:这允许 Dataflow 在需要时启动更多的 worker 实例,从而并行处理更多数据,分摊 CPU 负载。 2. 为 Dataflow worker 使用更大的机器类型:例如,从 n1-standard-1 升级到 n1-standard-4。更大的机器类型提供更多的 CPU 和内存资源,使每个 worker 能够处理更多数据或更复杂的操作,从而提高整体吞吐量。 其他选项: 将 Dataflow 流水线迁移到 us-central1 区域运行:这不会解决 CPU 限制问题,反而可能因跨区域数据传输增加延迟。 插入中间 Bigtable 或 Cloud Spanner 表作为缓冲区:这会增加流水线的复杂性和延迟,并引入额外的存储成本,无助于直接解决 Dataflow 流水线的 CPU 瓶颈。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡