Amazon AIF-C01: MLOps 与部署 — 学习指南

属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.

部署与推理模式:实时、批量、无服务器和边缘

选择推理模式首先要权衡延迟、吞吐量、成本和运营复杂性等服务级指标。对于低延迟、高吞吐量的需求,典型的选择是预置的 Amazon SageMaker 实时终端节点(单模型或多模型终端节点)或带有自动扩展和 GPU 实例的 SageMaker Real-Time Inference;使用终端节点变体来实施金丝雀或蓝/绿部署。对于延迟不敏感的大型离线作业,SageMaker Batch Transform 或在 AWS Glue/EMR 上进行分布式处理具有成本效益且易于扩展。对于不可预测或低 QPS 的工作负载,SageMaker Serverless Inference 或从 AWS Lambda 调用模型(需要时可使用预置并发)可以减少管理开销和成本。边缘部署需要使用 SageMaker Edge Manager 打包模型,并通过 AWS IoT Greengrass 将其分发到连接间歇或有严格延迟/隐私需求的设备上。从业者常见的陷阱包括:为稀疏流量选择实时终端节点(导致成本高昂)、未能测试无服务器部署的冷启动、以及低估多模型终端节点的内存/GPU 需求。决策应以 SLO(p99 延迟、吞吐量)、模型大小、并发模式和预期的更新频率为指导;在确定托管模式之前,使用代表性流量进行性能分析至关重要。

模型注册表、管道和 CI/CD 实现可重复交付

一个稳健的生产工作流使用 SageMaker Model Registry 对构件进行版本控制、捕获模型血缘并管理审批工作流,并使用 SageMaker Pipelines 组合可重复的训练、验证和部署步骤。将基于 Git 的源代码控制与 AWS CodePipeline 和 CodeBuild 集成,可实现模型代码的 CI:单元测试、数据模式检查以及作为注册表晋升关卡的自动化模型评估。部署自动化应实现分阶段环境(开发 → 预生产 → 生产),并支持通过终端节点变体、蓝/绿部署或基于 Lambda 的路由进行自动回滚或流量转移。特征存储(SageMaker Feature Store)通过存储特征定义和时间戳来确保训练和推理的一致性。常见的陷阱包括:未能记录超参数和环境版本、未自动化验证测试(数据模式、性能阈值),以及缺少不可变构件(应将模型构件存储在 S3 或 ECR 中)。使用基础设施即代码(CloudFormation 或 CDK)进行终端节点配置,通过固定库版本和随机种子来确保可复现性,并规划与同一管道集成的再训练触发器(数据漂移、周期性计划)。

监控、Model Monitor 和运营控制

运营监控必须涵盖数据漂移、概念漂移、性能下降、延迟和资源利用率。Amazon SageMaker Model Monitor 可以基线化训练数据分布,并持续分析推理流量以检测特征漂移、缺失值和模式变化;当有真实标签(ground truth)可用时,Model Monitor 还可以跟踪预测质量和目标漂移。将推理日志记录到 Amazon S3 和 CloudWatch,并将日志流式传输到 Amazon Kinesis 或 Amazon EventBridge,以实现实时警报和自动化管道触发。避免常见错误,例如将每个漂移警报都视为再训练信号——瞬时变化和季节性可能导致误报——或在不了解自然波动的情况下设置阈值。对于不平衡类别,优先使用精确率、召回率和 F1 分数而非准确率来检测有意义的性能下降。为模型构件实施 RBAC 和加密(KMS),使用 VPC 终端节点和 AWS PrivateLink 进行安全的服务访问,并通过 AWS CloudTrail 捕获审计跟踪。维护用于修复问题的运营手册:验证数据管道、比较近期队列的性能,并进行再训练、回滚或应用校准和特征修复。

可解释性、模型卡和合规性就绪控制

可解释性必须是可操作、可审计的,并根据利益相关者的需求进行调整。Amazon SageMaker Clarify 提供训练前偏差检查、训练后偏差指标以及通过 SHAP 实现的单次预测特征归因,这些都可以在推理时或在离线批处理中生成。运行时解释应与预测和输入指纹一同记录,以提供可追溯性;将解释存储在 S3 中并为其建立索引以便检索。模型卡(Model Cards)记录了预期用途、数据来源、相关数据切片上的评估指标、已知限制和性能注意事项;在模型注册表(Model Registry)中维护模型卡版本以满足治理要求。金融和受监管的用例需要确定性的审计跟踪:保留模型构件、超参数、评估数据和解释日志;为高影响决策实施“人在环路”(human-in-the-loop)审批关口,并为疑难案例维护反事实解释。为了与托管基础模型安全集成,请使用 AWS PrivateLink 接口端点从 VPC 内部调用 Amazon Bedrock,使用 KMS 加密负载,并应用精细的 IAM 和网络控制。嵌入存储和向量搜索的服务选择取决于检索需求;按性能和运营成本比较各种选项:

实践问题:用例场景

场景:FinSight 公司在 AWS 中运营一个信贷决策流程,使用 SageMaker 进行模型训练,使用 Bedrock 生成辅助性解释,并使用 Amazon S3 存储数据。模型作为 SageMaker 实时端点部署在 VPC 内部,并启用了 Model Monitor 来分析传入的特征。

挑战:Model Monitor 标记了特征漂移已超出阈值,并且业务法规要求对任何自动化的信用额度变更都必须有可审计、可解释的决策。

推荐方法:

  1. 使用 SageMaker Model Monitor 警报触发一个 EventBridge 规则,该规则将漂移数据发送到 SageMaker Pipelines 再训练工作流,并将当前的推理数据和最近的输入数据快照到 S3 隔离存储桶中。
  2. 在 SageMaker Pipelines 中运行一个自动化验证作业,将最近的数据分布与基线进行比较,计算评估指标(精确率/召回率/F1),并使用 SageMaker Clarify 为一个有代表性的样本群体生成逐样本的 SHAP 解释。
  3. 如果自动化检查通过,则在 SageMaker Model Registry 中注册新模型,并附上更新后的模型卡,其中包含性能切片和解释;使用端点变体和流量转移进行分阶段部署。如果检查失败,则在运维队列中创建一个事件,并在任何部署前调用人工审核步骤。
  4. 为了安全地调用 Bedrock 以生成人类可读的解释,通过 AWS PrivateLink 路由 Bedrock 流量,并使用 KMS 加密负载;将所有解释输出记录在 S3 中,并将其链接到推理记录以实现可审计性。

基本原理:此方法将自动化检测、可复现的验证和受保护的部署与审计跟踪和逐决策解释相结合,使操作控制与法规透明度保持一致,并最大限度地减少错误的再训练/回滚操作。


模型训练、评估与优化 · 所有领域 · AI

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Amazon →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品