Amazon AIF-C01: ML 数据工程 — 学习指南
属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.
数据收集、标注、版本控制和治理
收集具有代表性、可审计的数据集是所有机器学习的基础步骤。使用 Amazon S3 作为中央持久化存储,并启用 S3 版本控制和对象锁定,以保存原始输入并捕获数据溯源信息。对于结构化数据的摄取和编目,请在 AWS Glue Data Catalog 中注册数据集,并使用 Lake Formation 应用精细的访问控制。当需要人工标注时,Amazon SageMaker Ground Truth 提供内置工作流、标注用户界面和主动学习循环,可在降低标注成本的同时,为标注员一致性和置信度创建元数据。常见的陷阱包括收集有偏见或不具代表性的样本、未能记录数据血缘和标注规则,以及标签质量检查不足;可通过存储标注审计记录、对子集进行盲标复核以及使用标签合并启发式方法来缓解这些问题。隐私和合规性决策驱动架构设计:使用 S3 服务器端加密和 KMS 管理的 CMK,通过 IAM 策略和 VPC 端点 (AWS PrivateLink) 限制访问,并在共享数据用于模型训练之前,使用 Amazon Comprehend 执行 PII(个人身份信息)发现和脱敏处理。对于长期运行的项目,应捕获数据集快照,用数据集 ID 进行标记,并使用 Amazon SageMaker Experiments 或 DVC 等外部工具跟踪实验,以实现可复现的训练和满足监管报告要求。
预处理、特征工程和 EDA
数据转换和特征工程决定了模型的泛化能力。使用 AWS Glue 或 Amazon SageMaker Data Wrangler 来分析、清洗和规范化数据,并使用 Amazon QuickSight 或托管在 Amazon SageMaker Studio 中的 Jupyter notebook 进行迭代式探索性数据分析 (EDA)。对于生产环境的特征管理,应采用 Amazon SageMaker Feature Store 来确保离线和在线特征计算的一致性,避免训练/服务偏斜;将原始特征和派生特征分开存储,并记录特征创建逻辑。时间序列和流式处理管道应利用 Amazon Kinesis 或 AWS Glue 流式 ETL 来实现低延迟的特征刷新。典型的陷阱包括数据泄露(即未来信息泄露到训练数据中)、缺失值处理不当,以及离线训练特征与在线服务特征不匹配。设计管道时的决策标准取决于数据新鲜度与成本的权衡:对于大量的历史数据重新计算,选择批处理 ETL;对于近实时的个性化需求,选择流式处理;当需要低延迟的在线特征时,选择混合架构。在 Glue 中或作为 SageMaker Processing 作业的一部分,自动化验证检查和 schema 强制执行,以便及早发现 schema 漂移。
嵌入、增强、合成数据以及用于基础模型的数据集
嵌入 (Embeddings) 将文本、图像或多模态输入转换为能够捕捉语义关系的密集向量;它们是语义搜索、检索增强生成 (RAG) 和聚类等应用的核心。构建一个检索增强生成 (RAG) 模式:使用 Amazon Bedrock 或 SageMaker 托管的编码器生成嵌入,将向量存储在 Amazon OpenSearch Service (k-NN)、Amazon Kendra 或托管的向量存储中,然后检索上下文来为基础模型提供信息。当真实样本稀缺时,数据增强和合成数据生成是非常实用的方法:使用 SageMaker 中的生成模型来创建释义、图像变换(通过 Albumentations 或 SageMaker Processing)或保护隐私的合成记录。警惕对合成数据的过度依赖——保真度差的合成数据可能会引入分布偏移,并使模型对生成过程中的人造痕迹产生过拟合。对于基础模型 (FM) 的训练数据集,应精心筛选高质量样本,使用提示词模板规范化格式,并在 S3 中对每个数据集快照进行版本控制。对于与第三方 FM 一起使用的私有数据,首选私有化微调路径(将计算资源引入 VPC),或部署仅检索的管道,该管道只向 FM 发送非敏感上下文,同时将源文档保留在安全的向量存储中;应用脱敏处理和 token 级别的掩码以防止数据泄露。提示词工程和指令模板(系统提示词)对于塑造模型响应至关重要;根据所需的确定性和创造性,调整 temperature、top_k 或 top_p 等参数。
评估、部署、监控和生命周期管理
评估必须是明确的,使用与业务目标一致的指标:回归任务使用 RMSE 或 MAE,二元分类评估精确率/召回率/F1 分数和 ROC AUC,而摘要生成任务则使用 ROUGE 的各种变体。在评估阶段进行验证和交叉验证,并保留一个盲测集用于最终验收。使用 Amazon SageMaker 端点(实时或无服务器推理)或 Amazon Bedrock 进行托管式 FM 服务来部署模型;通过选择更小的蒸馏模型、启用多模型端点或针对不可预测的流量使用 SageMaker Serverless Inference 来优化延迟。在生产环境中使用 Amazon SageMaker Model Monitor 监控性能和数据漂移,并为指标下降设置警报;采用金丝雀部署或蓝绿部署来限制风险。模型的访问控制通过 IAM 角色策略、资源级权限和网络隔离来强制执行。从业者常见的陷阱包括选择错误的指标(例如对不平衡类别使用准确率)、忽略概念漂移,以及未能对训练数据和推理日志进行检测以保证可审计性。使用 SageMaker Pipelines 为机器学习建立 CI/CD,以规范化重训练节奏、保持数据集和模型版本的一致性,并为合规性维护一个可靠的审计追踪。
实践问题:用例场景
场景:BrightCart 是一家在线食品杂货连锁店,正在将其本地库存系统现代化迁移到 AWS,并希望构建一个生成式 AI 聊天机器人。该机器人需要能够回答客户问题、返回实时库存位置,同时根据合规性规定保护客户和库存数据。他们的 AWS AI 环境包括:用于数据集的 S3、用于事务性库存的 Amazon RDS、用于开发的 SageMaker Studio、用于访问基础模型的 Bedrock 以及 VPC 网络。
挑战:构建一个私有的、低延迟的、支持 RAG 的聊天机器人,该机器人能够检索当前库存,并避免泄露敏感数据或引发幻觉。
推荐方法:
- 预置一个私有 VPC,并为 Bedrock 和 SageMaker 配置 AWS PrivateLink 端点;将标准产品文档和库存快照存储在 S3 中,使用服务器端加密(KMS),并启用 S3 版本控制。
- 在私有子网中,使用 Bedrock 编码器或 SageMaker 模型持续计算产品文档的嵌入向量,并将向量存储在 Amazon OpenSearch Service 中,利用 k-NN 实现快速的最近邻检索;将实时库存保留在 Amazon RDS 中,并提供一个安全的运行时连接器用于检索。
- 实现一个检索增强管道:应用程序首先查询 OpenSearch 获取上下文,然后使用一个包含所检索上下文和明确安全指令的系统提示模板来调用 Bedrock;通过输入验证来净化用户输入,并使用 Amazon Comprehend 在检索前检测并编辑个人身份信息(PII)。
- 将聊天机器人部署在 Application Load Balancer 之后,通过 VPC 内的 API Gateway 和 Bedrock 提供 FM 服务,启用对 CloudWatch 的日志记录并限制访问权限,同时使用 SageMaker Model Monitor 和定期的人工审计来监控模型响应和漂移。
理由:此方法使用 RAG 模式来最大程度地减少敏感数据暴露,利用私有网络和 KMS 来满足合规性要求,将实时库存与模型上下文分离以确保准确性,并应用监控和“人在环路”(human-in-the-loop)检查来控制幻觉并确保持续的可靠性。
← AI 安全与隐私 · 所有领域 · 模型训练、评估与优化 →
练习这些题目 → · 在 ExamRoll.io 上限时练习 →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
通过考试 →