Amazon AIF-C01: 模型训练、评估与优化 — 学习指南
属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.
训练策略与数据架构
设计训练策略首先要决定是从头开始训练、微调预训练模型,还是应用少样本/提示(few‑shot/prompting)技术。对于小型已标注数据集,对预训练模型(Amazon Bedrock 或 SageMaker JumpStart 模型)进行迁移学习可以加速收敛并提高泛化能力;对于大型领域特定语料库,可能需要在 SageMaker Training 上使用分布式实例(Horovod 或 SageMaker 托管的分布式训练)进行完整训练。数据架构至关重要:将原始数据和处理后的数据存储在 Amazon S3 中,在 Amazon SageMaker Feature Store 中管理特征,使用 AWS Glue 或 SageMaker Processing 进行转换,并用 Amazon SageMaker Ground Truth 进行标注。在对敏感数据进行微调时,通过 VPC 端点、KMS 加密和私有 Bedrock 连接器来强制执行安全性和隐私保护。常见的陷阱包括来自未来信息的标签泄漏、针对时序问题的时间性泄漏,以及导致指标偏差的不均衡采样。决策标准应权衡数据集大小、标签质量、延迟和成本限制以及法规要求;选择 Spot 训练以节省成本,但需验证其可复现性和检查点机制。使用 SageMaker Experiments 跟踪运行,并使用 Model Registry 对构件进行版本控制,从而实现可复现的比较和安全的回滚。
评估与验证指标
选择评估指标必须以业务目标为指导,而不是凭熟悉程度。对于分类问题,当假正例(false positive)代价高昂时(如欺诈警报),应优先考虑精确率(precision);当漏掉真正例(missing positive)的后果严重时(如疾病筛查),应优先考虑召回率(recall)。对于信息检索和摘要生成,ROUGE 和 BLEU 可以捕捉 n-gram 的重叠度和流畅性,而对于合规性要求高的答案,则需要人工评估或真实性指标。使用稳健的验证策略:分层 k 折(stratified k-fold)或时间序列感知的划分、专用的留出测试集(holdout test set),以及影子或金丝雀部署,以在真实流量下验证生产性能。模型校准和阈值选择通常需要精确率-召回率曲线(precision-recall curves)或 ROC-AUC 分析以及训练后校准方法。在技术指标之外,还应考虑面向业务的指标(如成本加权错误、客户流失提升率)。从业者常见的陷阱包括:在类别不均衡的情况下过度依赖准确率(accuracy),以及在事实一致性至关重要时仅使用 BLEU/ROUGE 评估自然语言生成(NLG)。可参考的指标定义:
- 准确率 (Accuracy): 正确预测的比例。
- 精确率 (Precision): 真正例(true positive)除以预测为正例的总数。
- 召回率 (Recall): 真正例除以实际为正例的总数。
- F1 分数 (F1 score): 精确率和召回率的调和平均数。
- ROC AUC: 受试者工作特征曲线(ROC)下的面积。
- BLEU: 用于类似翻译任务的、基于精确率的 n-gram 重叠度指标。
- ROUGE: 用于摘要生成的、面向召回率的 n-gram 重叠度指标。
过拟合、欠拟合、漂移与可解释性
当模型记住了训练数据中的噪声时,会产生过拟合;当模型无法捕捉到信号时,则会发生欠拟合。缓解措施包括提前停止(early stopping)、正则化(L1/L2)、针对神经网络的 dropout、数据增强和集成学习(ensembling)。对于表格类问题,特征工程和剪枝可以减少方差;对于大语言模型(LLM),选择性微调或提示调优(prompt tuning)可以避免灾难性遗忘。模型漂移表现为协变量漂移(输入分布变化)或概念漂移(标签关系变化)。使用 Amazon SageMaker Model Monitor 实施持续监控以检测数据和预测漂移,并使用 SageMaker Pipelines 或基于 AWS Lambda 和 Step Functions 的事件驱动工作流来编排周期性再训练。对于受监管的环境,应用可解释性和公平性工具:SageMaker Clarify 提供特征重要性、偏差指标以及训练前/后报告;集成到推理管道中的 SHAP 和 LIME 提供局部解释。常见的陷阱包括将数据质量问题与模型性能下降相混淆、将再训练推迟到性能低于业务阈值之后,以及未能记录输入/输出以进行根本原因分析。针对低置信度或高风险的预测,使用 Amazon Augmented AI (A2I) 设计人机协同(human-in-the-loop)审查流程。
优化、超参数调优与生命周期管理
超参数调优和部署策略决定了模型是否能满足准确性、延迟和成本目标。使用 SageMaker 自动模型调优来运行贝叶斯搜索、随机搜索或 Hyperband 搜索,并在希望进行迭代改进而不重新探索效果不佳的区域时,使用热启动调优任务。根据维度和计算预算选择搜索策略:网格搜索适用于小型离散空间,随机搜索适用于广泛覆盖,贝叶斯搜索适用于高效收敛。通过使用 SageMaker Debugger 进行性能分析来针对运营约束进行优化,以收集指示梯度消失或瓶颈的张量和规则,并根据内存和 CPU/GPU 需求选择实例类型。在 Bedrock 中或通过 SageMaker 微调基础模型时,应考虑参数高效技术(如适配器层、提示词调优),以控制成本并降低对基础模型行为的风险。对于部署,应在 SageMaker 模型注册表中注册模型,使用 CodePipeline 和 SageMaker Projects 创建 CI/CD,并根据流量情况使用 SageMaker 端点或无服务器推理提供服务。常见的陷阱包括以不成比例的成本追求边际指标增益、忽略校准和置信度评分(导致脆弱的人工审核触发器),以及未能将数据集与模型一起进行版本控制;应在 Feature Store 和 Glue Catalog 中整合数据集血缘以保持可复现性。
实践问题:用例场景
场景:FinBank 是一家中型金融服务公司,在 AWS 上运行模型,并将交易和客户元数据存储在 S3 和 SageMaker Feature Store 中。他们使用 Bedrock 构建生成式助手,并使用 SageMaker 构建预测模型。
挑战:客户流失预测模型在接收一周的生产数据后表现出性能下降,团队需要一个受控的计划来衡量漂移、更新模型,并确保满足可解释性要求。
推荐方法:
- 部署 Amazon SageMaker Model Monitor 来捕获特征分布、预测摘要,并检测相对于基线数据集的协变量漂移和预测漂移。
- 如果检测到漂移,触发一个 SageMaker Pipeline 来运行数据验证(使用 Glue 和 AWS Data Wrangler)、重新平衡或增强数据,并使用带有热启动超参数调优的 SageMaker Training 创建一个重新训练任务。
- 在部署前,运行 SageMaker Clarify 进行公平性和特征重要性分析,并生成可解释性报告;将低置信度的预测路由到 Amazon Augmented AI (A2I) 人工审核工作流。
- 在 SageMaker 模型注册表中注册新模型,将其部署到一个金丝雀 SageMaker 端点,并执行影子流量测试,然后根据业务 KPI 的 CloudWatch 警报进行分阶段推出。
理由:使用 Model Monitor 进行持续监控可以及早发现漂移;自动化管道确保了可复现性和经济高效的重新训练,而 Clarify 和 A2I 提供了符合 AWS AI 从业者最佳实践的合规级别解释和人工监督。
← ML 数据工程 · 所有领域 · MLOps 与部署 →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →