Amazon AIF-C01: AI 和 ML 基础 — 学习指南
属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.
核心概念与模型类型
理解核心术语是构建稳健架构和进行权衡决策的基础。监督学习将输入映射到带标签的输出,并分为用于连续目标的回归和用于离散类别的分类;与二元决策相比,多类别分类(例如 20 个基因类别)会影响模型选择和损失函数。非监督学习通过聚类和降维在无标签数据中发现结构,用于分割和异常检测。常见的算法系列包括线性模型和树集成模型(可解释性强,处理表格数据速度快)、核方法 (SVM) 以及神经网络(灵活,对图像、音频和文本具有高容量)。对于图像任务,卷积网络或预训练的视觉基础模型(通过 Amazon SageMaker JumpStart 或 Amazon Rekognition Custom Labels)占主导地位;对于文本任务,Transformer 架构为大型语言模型和序列模型提供支持。可解释性要求促使从业者选择更简单的模型或使用 SageMaker Clarify 等可解释性工具。模型选择需要在预测性能、可解释性、推理延迟和成本之间取得平衡:如果要求透明度,基于树的模型可能足以用于基因分类,而深度模型则适合高维图像或语言任务。了解这些算法系列,并知道何时重用预训练模型而非从头开始训练,有助于指导构建高效、合规的解决方案。
机器学习生命周期、数据和特征管理
机器学习生命周期始于问题定义、数据收集、标注、特征工程、训练、验证、部署、监控和迭代。在 AWS 环境中,SageMaker 负责协调生命周期的多个阶段:使用 SageMaker Processing 进行数据转换,使用 SageMaker Feature Store 进行集中式特征存储和在线/离线服务,以及使用 SageMaker Pipelines 实现模型工作流的 CI/CD。标签质量和类别平衡是常见的瓶颈;应投入建设稳健的标注流程,或使用 SageMaker Ground Truth 减少噪声标签,并利用主动学习来集中人力。特征血缘和访问控制对于可复现性和治理至关重要;应在 SageMaker Model Registry 中注册特征和模型,并使用生命周期策略在 Amazon S3 中对数据集进行版本控制。对于生产环境,应通过 SageMaker Model Monitor 实现自动化模型监控,以检测数据漂移、概念漂移和准确性下降,并通过 Amazon CloudWatch 和 AWS Lambda 集成警报。设计具有幂等性和恢复能力的管道:使用事件驱动模式(S3 事件、Step Functions),并根据延迟和吞吐量要求设计可扩展的计算和存储——在 EC2/GPU 或 Trainium 上进行训练,在 Inf1/Neptune/Graviton 实例上进行推理。
评估、算法和常见陷阱
选择评估指标和基线是一项决定性的实践。对于分类问题,应考虑精确率、召回率、F1 分数和 ROC 曲线下面积;对于多类别分类,使用每个类别的召回率以及宏/微平均值。回归评估使用 RMSE、MAE 和 R-squared。对于生产服务,运行时效率通过尾部延迟 (P95/P99) 和吞吐量(每秒请求数)以及单次推理成本来衡量。典型的陷阱包括在不平衡数据集上选择准确率作为指标、在测试数据上过度进行超参数调优导致过拟合,以及在将概率用于业务决策时忽略校准。使用交叉验证和留出验证,并实施基线模型(简单的启发式方法),以确保机器学习能带来附加价值。当带标签的数据稀缺时,可使用迁移学习、针对图像的数据增强或半监督方法。为了可解释性和合规性,可将不透明模型与事后解释器(SHAP、集成梯度)配对使用,并集成 SageMaker Clarify。AWS 上的常见算法选择:对于表格数据,使用 XGBoost 并通过 SageMaker 进行快速训练;对于图像,在 GPU 实例上通过 Torch/TensorFlow 使用 CNN;对于文本,使用 SageMaker 上的 Hugging Face 或 Bedrock 基础模型进行检索增强生成。
基础模型、部署模式与安全性
基础模型可以加速开发,但也引入了独特的架构选择和安全考量。Amazon Bedrock 提供对多个基础模型的托管访问,并支持微调、检索增强生成 (RAG) 工作流,以及与 Amazon OpenSearch Service (k-NN) 或 Amazon Kendra 等向量存储集成以进行语义搜索。根据数据规模和安全需求,在微调、指令调优或轻量级适配器之间进行选择。对于低延迟、高吞吐量的推理,可以考虑在 Amazon EC2 Inf1 (Inferentia) 上部署优化后的模型,或使用 SageMaker Neo/Edge Manager 在边缘设备上编译和托管模型;要在设备上实现绝对最低的延迟推理,则需要通过 SageMaker Edge Manager 或 AWS IoT Greengrass 进行模型量化、剪枝和本地运行时部署,但这需要在模型大小和准确性之间进行权衡。安全模式包括 VPC 端点、用于 Bedrock 的 AWS PrivateLink、严格的 IAM 角色、由 KMS 支持的 S3 敏感数据加密以及审计日志记录。为减少幻觉和提示词攻击,应实施护栏措施:输入清洗、提示词模板、响应过滤器以及 RLHF 或后处理检查。使用 CloudTrail 监控使用情况和异常 API 调用,并实施速率限制和异常检测,以保护模型访问和数据隐私。
实践问题:用例场景
场景:GreenGene Labs 使用一个 AWS AI 环境,其中 Amazon S3 用于存储原始数据,SageMaker 用于模型开发,Amazon Bedrock 用于试验基础模型。他们将敏感的基因组和临床元数据置于严格的访问控制之下,并需要为研究仪表板提供可扩展的推理能力。
挑战:将人类基因样本分为 20 个类别,要求决策逻辑透明,能在团队间维护特征复用,并为研究人员部署一个受监控的低延迟 API。
推荐方法:
- 使用 SageMaker Processing 和 Ground Truth 准备和标注数据,并将整理好的特征存储在 SageMaker Feature Store 中。
- 在 SageMaker Training 中训练可解释模型(XGBoost、决策树);在 SageMaker Model Registry 中注册模型并记录其血缘关系。
- 将最佳模型部署到 Application Load Balancer 之后并带有自动扩展功能的 SageMaker endpoint;启用 SageMaker Model Monitor 以进行漂移检测,并设置 CloudWatch 警报。
- 对于需要更大表示的实验,可使用 Bedrock 或 Hugging Face 模型生成嵌入,并添加 OpenSearch 向量索引以进行相似性搜索;将其与可解释模型相结合以进行最终分类。
理由:集中的特征管理和可复现的管道减少了数据泄露并加速了协作,同时,优先使用可解释模型满足了透明度需求,而 Bedrock 嵌入在不牺牲治理的情况下实现了更丰富的表示。
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →