Amazon AIF-C01: MLOps 与部署 — 学习指南
属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.
部署与推理模式:实时、批量、无服务器和边缘
选择推理模式首先要权衡延迟、吞吐量、成本和运营复杂性等服务级指标。对于低延迟、高吞吐量的需求,典型的选择是预置的 Amazon SageMaker 实时终端节点(单模型或多模型终端节点)或带有自动扩展和 GPU 实例的 SageMaker Real-Time Inference;使用终端节点变体来实施金丝雀或蓝/绿部署。对于延迟不敏感的大型离线作业,SageMaker Batch Transform 或在 AWS Glue/EMR 上进行分布式处理具有成本效益且易于扩展。对于不可预测或低 QPS 的工作负载,SageMaker Serverless Inference 或从 AWS Lambda 调用模型(需要时可使用预置并发)可以减少管理开销和成本。边缘部署需要使用 SageMaker Edge Manager 打包模型,并通过 AWS IoT Greengrass 将其分发到连接间歇或有严格延迟/隐私需求的设备上。从业者常见的陷阱包括:为稀疏流量选择实时终端节点(导致成本高昂)、未能测试无服务器部署的冷启动、以及低估多模型终端节点的内存/GPU 需求。决策应以 SLO(p99 延迟、吞吐量)、模型大小、并发模式和预期的更新频率为指导;在确定托管模式之前,使用代表性流量进行性能分析至关重要。
模型注册表、管道和 CI/CD 实现可重复交付
一个稳健的生产工作流使用 SageMaker Model Registry 对构件进行版本控制、捕获模型血缘并管理审批工作流,并使用 SageMaker Pipelines 组合可重复的训练、验证和部署步骤。将基于 Git 的源代码控制与 AWS CodePipeline 和 CodeBuild 集成,可实现模型代码的 CI:单元测试、数据模式检查以及作为注册表晋升关卡的自动化模型评估。部署自动化应实现分阶段环境(开发 → 预生产 → 生产),并支持通过终端节点变体、蓝/绿部署或基于 Lambda 的路由进行自动回滚或流量转移。特征存储(SageMaker Feature Store)通过存储特征定义和时间戳来确保训练和推理的一致性。常见的陷阱包括:未能记录超参数和环境版本、未自动化验证测试(数据模式、性能阈值),以及缺少不可变构件(应将模型构件存储在 S3 或 ECR 中)。使用基础设施即代码(CloudFormation 或 CDK)进行终端节点配置,通过固定库版本和随机种子来确保可复现性,并规划与同一管道集成的再训练触发器(数据漂移、周期性计划)。
监控、Model Monitor 和运营控制
运营监控必须涵盖数据漂移、概念漂移、性能下降、延迟和资源利用率。Amazon SageMaker Model Monitor 可以基线化训练数据分布,并持续分析推理流量以检测特征漂移、缺失值和模式变化;当有真实标签(ground truth)可用时,Model Monitor 还可以跟踪预测质量和目标漂移。将推理日志记录到 Amazon S3 和 CloudWatch,并将日志流式传输到 Amazon Kinesis 或 Amazon EventBridge,以实现实时警报和自动化管道触发。避免常见错误,例如将每个漂移警报都视为再训练信号——瞬时变化和季节性可能导致误报——或在不了解自然波动的情况下设置阈值。对于不平衡类别,优先使用精确率、召回率和 F1 分数而非准确率来检测有意义的性能下降。为模型构件实施 RBAC 和加密(KMS),使用 VPC 终端节点和 AWS PrivateLink 进行安全的服务访问,并通过 AWS CloudTrail 捕获审计跟踪。维护用于修复问题的运营手册:验证数据管道、比较近期队列的性能,并进行再训练、回滚或应用校准和特征修复。
- 关键评估指标及其适用场景
- 准确率 (Accuracy): 整体正确性;在不平衡数据上具有误导性
- 精确率 (Precision): 正向预测的正确性;在假正例(false positive)代价高昂时使用
- 召回率 (Recall/Sensitivity): 找出所有正例的能力;在假负例(false negative)代价高昂时使用
- F1 分数 (F1 score): 精确率和召回率的调和平均数;适用于不平衡类别的均衡选择
- AUC-ROC: 跨阈值的排序质量;适用于与阈值无关的二元分类器评估
可解释性、模型卡和合规性就绪控制
可解释性必须是可操作、可审计的,并根据利益相关者的需求进行调整。Amazon SageMaker Clarify 提供训练前偏差检查、训练后偏差指标以及通过 SHAP 实现的单次预测特征归因,这些都可以在推理时或在离线批处理中生成。运行时解释应与预测和输入指纹一同记录,以提供可追溯性;将解释存储在 S3 中并为其建立索引以便检索。模型卡(Model Cards)记录了预期用途、数据来源、相关数据切片上的评估指标、已知限制和性能注意事项;在模型注册表(Model Registry)中维护模型卡版本以满足治理要求。金融和受监管的用例需要确定性的审计跟踪:保留模型构件、超参数、评估数据和解释日志;为高影响决策实施“人在环路”(human-in-the-loop)审批关口,并为疑难案例维护反事实解释。为了与托管基础模型安全集成,请使用 AWS PrivateLink 接口端点从 VPC 内部调用 Amazon Bedrock,使用 KMS 加密负载,并应用精细的 IAM 和网络控制。嵌入存储和向量搜索的服务选择取决于检索需求;按性能和运营成本比较各种选项:
- Amazon OpenSearch Service (k-NN): 可扩展的向量搜索,集成了分析功能
- Amazon Kendra: 托管的语义搜索,内置连接器和企业级功能
- Amazon RDS (Postgres + pgvector): 事务性向量存储,对于关系型数据集更简单
- 在 Amazon EKS 或 ECS 上的自定义 ANN: 为 NMSLIB/FAISS 提供了最高的灵活性,但运维负担更重
实践问题:用例场景
场景:FinSight 公司在 AWS 中运营一个信贷决策流程,使用 SageMaker 进行模型训练,使用 Bedrock 生成辅助性解释,并使用 Amazon S3 存储数据。模型作为 SageMaker 实时端点部署在 VPC 内部,并启用了 Model Monitor 来分析传入的特征。
挑战:Model Monitor 标记了特征漂移已超出阈值,并且业务法规要求对任何自动化的信用额度变更都必须有可审计、可解释的决策。
推荐方法:
- 使用 SageMaker Model Monitor 警报触发一个 EventBridge 规则,该规则将漂移数据发送到 SageMaker Pipelines 再训练工作流,并将当前的推理数据和最近的输入数据快照到 S3 隔离存储桶中。
- 在 SageMaker Pipelines 中运行一个自动化验证作业,将最近的数据分布与基线进行比较,计算评估指标(精确率/召回率/F1),并使用 SageMaker Clarify 为一个有代表性的样本群体生成逐样本的 SHAP 解释。
- 如果自动化检查通过,则在 SageMaker Model Registry 中注册新模型,并附上更新后的模型卡,其中包含性能切片和解释;使用端点变体和流量转移进行分阶段部署。如果检查失败,则在运维队列中创建一个事件,并在任何部署前调用人工审核步骤。
- 为了安全地调用 Bedrock 以生成人类可读的解释,通过 AWS PrivateLink 路由 Bedrock 流量,并使用 KMS 加密负载;将所有解释输出记录在 S3 中,并将其链接到推理记录以实现可审计性。
基本原理:此方法将自动化检测、可复现的验证和受保护的部署与审计跟踪和逐决策解释相结合,使操作控制与法规透明度保持一致,并最大限度地减少错误的再训练/回滚操作。
← 模型训练、评估与优化 · 所有领域 · AI →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →