您的训练在主循环中使用了自定义的 C++ TensorFlow ops(大量的矩阵乘法);训练需要数天时间。您希望在 Google Cloud 上使用加速器来减少时间并保持低成本。您应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 继续使用 CPU,并增加训练模型的集群规模。.
为什么这是答案
正确答案是继续使用 CPU,并增加训练模型的集群规模。由于您的训练使用了自定义的 C++ TensorFlow ops,并且涉及大量的矩阵乘法,这意味着这些自定义操作可能没有针对 GPU 或 TPU 进行优化。在没有为自定义操作实现 GPU 内核支持的情况下,直接使用 Cloud TPU 或 Cloud GPU 不会带来性能提升,甚至可能因为数据传输开销而导致性能下降。Cloud TPU 尤其需要模型和操作专门针对其架构进行优化。因此,最直接且可能最经济的解决方案是继续使用 CPU,并通过增加集群规模(例如,使用更大的虚拟机或更多的虚拟机)来并行化训练,从而缩短训练时间。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡