FinTrust Inc. 训练了一个表格欺诈检测模型,并将训练 CSV 存储在 s3://fintrust-training/transactions/ 中。ML 平台团队必须从训练数据中创建 SageMaker Model Monitor 数据质量基线(统计数据和约束),以便对生产推理输入模式和分布进行日常监控,并在出现漂移时发出警报。以下哪种方法是生成适用于 MonitoringSchedule 的 Model Monitor 基线的最合适、工作量最小的方式?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 运行 DefaultModelMonitor.suggest_baseline (SageMaker Python SDK) 或调用等效的 CreateProcessingJob,使用 SageMaker Model Monitor 容器从训练 S3 路径计算 Statistics 和 Constraints,并将输出基线保存到指定的 S3 基线配置路径。.
为什么这是答案
此方法利用 SageMaker Model Monitor 的内置功能,直接从训练数据生成数据质量基线。DefaultModelMonitor.suggestbaseline(或等效的 CreateProcessingJob)旨在自动分析训练数据集,计算统计数据和推断约束,并将其存储在 S3 中,这是 Model Monitor 监控计划所需的格式。这最大限度地减少了手动工作,并确保了基线与训练数据的一致性。 其他选项的不足之处: 在生产端点上启用数据捕获一周:这会延迟基线的创建,并且基线将基于生产数据而不是原始训练数据,可能无法准确反映模型的预期输入。 使用 AWS Glue 计算列统计数据并手动转换:这需要大量的手动工作来将 Glue 统计数据转换为 Model Monitor 所需的特定 JSON 格式,容易出错且效率低下。 对训练 CSV 运行 Amazon Athena 查询并存储为 CloudWatch 指标:Model Monitor 不直接使用 CloudWatch 指标作为其数据质量基线。它需要特定的统计文件和约束文件来定义基线。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡