ShopScale 在一个 Experiment 下运行了数十个 SageMaker 训练作业(脚本模式,使用内置 XGBoost)。每个训练作业在每个 epoch 将指标 'validation:accuracy' 记录到 TrialComponent 中。ML 团队需要一个自动化的编程报告,比较 Experiment 中所有 TrialComponent 在第 10 个 epoch 的 validation:accuracy,以选择最佳运行进行部署。哪种方法能最直接、编程地聚合跨运行的指标?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 SageMaker Experiments Python SDK 的 TrialComponentAnalytics(或 sagemaker.analytics.TrialComponentAnalytics)根据指标名称和 epoch 筛选 Experiment 的 TrialComponent,并计算聚合比较。.
为什么这是答案
正确答案是使用 SageMaker Experiments Python SDK 的 TrialComponentAnalytics。SageMaker Experiments 旨在跟踪和管理机器学习实验,TrialComponentAnalytics 类提供了直接、编程的方式来查询、筛选和聚合实验中的指标,包括特定 epoch 的指标。这正是题目要求的功能,即比较所有 TrialComponent 在第 10 个 epoch 的 validation:accuracy。 直接查询 CloudWatch 指标虽然可行,但效率低下且复杂,因为它需要手动关联 CloudWatch 指标与 SageMaker Experiment 的 TrialComponent。将日志导出到 S3 并使用 Glue ETL 解析过于繁琐,且偏离了 SageMaker Experiments 的核心功能。SageMaker Model Monitor 用于监控部署后的模型性能,而不是比较训练实验中的指标。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡