一位机器学习工程师使用估算器在 SageMaker Studio notebook 中训练神经网络。Python 训练脚本在具有多个 GPU 的单个实例上使用分布式数据并行 (DDP),但 GPU 利用率不足。工程师需要找出训练脚本中优化资源使用的位置。哪种方法可以确定该位置?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在训练脚本中添加 SageMaker Profiler 注解,运行脚本,并根据结果生成一份 profiler 报告。.
为什么这是答案
SageMaker Profiler 专为识别训练作业中的性能瓶颈而设计,包括 GPU 利用率不足。通过在训练脚本中添加 Profiler 注解并运行作业,Profiler 会收集详细的系统和框架指标,例如 GPU 利用率、CPU 利用率、内存使用情况以及数据加载时间。生成的 Profiler 报告会可视化这些数据,并提供具体建议,帮助工程师 pinpoint 瓶颈所在,例如数据加载缓慢或模型计算效率低下,从而优化资源使用。 其他选项的解释: 使用 Amazon CloudWatch 指标创建报告:CloudWatch 提供了高层级的 GPU 利用率数据,但无法深入到训练脚本内部,无法指出具体是哪部分代码导致了利用率不足。 使用 AWS CloudTrail 生成报告:CloudTrail 记录的是 API 调用活动,与 GPU 利用率和训练脚本的性能无关。 在 Amazon SageMaker Model Monitor 中创建默认监视器:Model Monitor 用于监控部署模型的性能和数据漂移,而不是训练作业的资源利用率。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡