一个用 TensorFlow 实现的时间序列预测模型在单个 GPU 上运行,每天需要大约 23 小时进行训练。团队预计训练数据会增长,并且将来需要每小时重新训练一次,同时最大限度地减少代码和基础设施的更改。哪种改变能最好地让训练扩展以满足未来的需求?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 修改 TensorFlow 代码以使用 Amazon SageMaker 支持的 Horovod 分布式框架,并根据需要跨多台机器并行训练。.
为什么这是答案
正确答案是修改 TensorFlow 代码以使用 Amazon SageMaker 支持的 Horovod 分布式框架,并根据需要跨多台机器并行训练。Horovod 是一个分布式训练框架,它与 TensorFlow 兼容,并允许在多 GPU 或多节点上高效地并行训练模型,从而显著缩短训练时间。将其与 SageMaker 结合使用,可以轻松扩展基础设施,满足未来每小时重新训练的需求,同时最大限度地减少对现有 TensorFlow 代码的改动。 迁移到更强大的单个 GPU 机器可能无法满足未来每小时重新训练的需求,因为训练数据会增长,单个 GPU 的性能提升是有限的。用 Amazon SageMaker DeepAR 模型替换现有模型需要完全重写模型,这与“最大限度地减少代码和基础设施的更改”的要求相悖。将训练工作负载迁移到 Amazon EMR 虽然可以实现分布式训练,但通常比 SageMaker 的集成解决方案需要更多的基础设施管理和代码修改。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡