Amazon MLA-C01: 计算机视觉、NLP 与专业化 ML — 学习指南

属于 AWS Machine Learning Engineer Associate MLA-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.

核心概念

AWS 中的计算机视觉和 NLP 解决方案取决于三个层面的问题:数据摄取与安全、特征与标签准备,以及模型生命周期(训练、注册、部署、监控)。对于图像分类和目标检测,训练工作流的核心是将带标签的资产存储在 Amazon S3 中,并实施严格的加密和网络控制。目标检测的标注格式通常为 Pascal VOC / COCO,而高吞吐量训练则使用 RecordIO 或 TFRecord 格式。对于文本分类和命名实体识别 (NER),输入通常是分词后的序列(Transformer 模型使用 WordPiece/BPE)或带有标签的行分隔 JSON;当使用 Rekognition Textract 的输出或人工标注的范围时,预处理必须保留 token 到字符的偏移量,以确保 NER 标签对齐的一致性。对于表格类欺诈模型的特征工程,重点在于时间窗口聚合、分类基数缩减,以及在训练和提供服务之间保持一致的编码;使用集中的转换(例如 Feature Store 或 Data Wrangler 流程)可以防止离线训练和在线推理之间的偏差。

模型构建的选择对应于专门的 AWS 服务:Amazon SageMaker 提供内置算法(XGBoost、Linear Learner、Random Cut Forest)和托管的框架容器(MXNet、TensorFlow、PyTorch),以及用于偏差和可解释性分析的 SageMaker Clarify。当需要低运营开销时,Amazon Rekognition 涵盖了用于标签、人脸/名人检测的预构建图像 API,以及通过 Rekognition Custom Labels 进行的自定义标签训练。对于从文档中提取文本和结构化数据,Amazon Textract 提供 OCR 和表单/表格提取功能;对于情感分析、实体识别或主题建模等语言层面的任务,Amazon Comprehend 提供托管 API,而 Comprehend Medical 则用于临床 NER。在生产环境中,至关重要的一点是将这些部分整合到一个一致的管道中,从而使预处理、模型输入和监控都可复现和可审计。

关键服务与配置

需要了解的核心 AWS 服务及相关的 API/配置参数包括:Amazon SageMaker (TrainingJob, ModelPackage, ModelPackageGroup, ModelRegistry)、SageMaker Pipelines (RegisterModel, CallbackStep, ConditionStep)、SageMaker Model Monitor 和 Clarify (BaselineConfig, DataConfig, ModelConfig, bias_config)、Amazon Rekognition、Amazon Comprehend、Amazon Textract、AWS Glue 和 Lake Formation。为了实现安全的隔离存储,应配置 S3 使用 SSE-KMS 进行服务器端加密(通过 S3.PutBucketEncryption 并指定 SSEKMSKeyId),附加存储桶策略以限制对 SageMaker 执行角色的访问,并为 S3 启用网关 VPC 端点以进行私有网络传输。启动训练任务时,在 CreateTrainingJob 中设置 VpcConfig 参数(SecurityGroupIdsSubnets),使实例在客户的 VPC 中运行,并启用 NetworkIsolationInstanceMetadataServiceConfiguration 来限制访问。

为了以最小的运营开销集中管理模型,可以使用 SageMaker Model Registry,方法是创建一个 ModelPackageGroup,并通过 CreateModelPackage 添加 ModelPackage 版本,同时将 ModelApprovalStatus 设置为 ‘PendingManualApproval’。通过在 SageMaker Pipelines 中添加一个 CallbackStep 或一个专门的“手动批准”步骤来自动化手动批准门控;管道会等待一个外部信号,然后您可以调用 UpdateModelPackageModelApprovalStatus 设置为 ‘Approved’ 以进行部署。对于已部署的实时端点,如需进行按需的偏差或漂移评估,可使用 SageMaker Clarify 进行偏差指标分析,使用 SageMaker Model Monitor 进行数据和预测漂移分析:在 CreateEndpoint 中启用 DataCaptureConfigEnableCapture, CaptureOptions, DestinationS3Uri)来捕获推理负载,然后通过 CreateProcessingJob 启动一个 Clarify 处理作业,并使用 Clarify SDK 的 DataConfigModelConfigbias_config 参数来立即计算漂移指标。

相关服务包括:

设计模式与权衡

对于欺诈检测等表格分类任务,实用的设计模式是使用 AWS Glue 或 DMS 将关系型表等原始数据源集中到安全的 S3 数据湖中,在 Glue Data Catalog 中对其进行编目,并通过 Lake Formation 强制执行访问控制。转换在 SageMaker Data Wrangler 流或 Glue ETL 作业中表达一次,并持久化到 SageMaker Feature Store 中,以便在训练和推理时运行相同的转换。选择 Feature Store 会增加前期的操作步骤,但能减少特征偏斜和调试时间;在作业内直接进行转换的初始开销较低,但使可复现性和在线特征计算变得更加困难。对于训练算法,XGBoost(SageMaker 提供的容器)因其出色的表格数据处理性能和对权重列的支持,是欺诈检测任务的一个强大默认选项;在 CreateTrainingJob 中使用 HyperParameters 配置超参数,并通过传递权重列或设置 scale_pos_weight 来应对类别不平衡问题,从而避免了更复杂的重采样管道。

对于计算机视觉,如果您需要快速迭代且标记数据有限,Rekognition Custom Labels 提供了操作最少的最快路径;若要获得最大控制权和使用自定义架构,请使用 SageMaker 结合 MXNet/PyTorch 进行训练,并将数据集以 RecordIO 或 ImageFolder 格式存储在 S3 上。对于目标检测,首选使用输出 COCO 格式的框架进行训练,并通过指定 InstanceType=ml.p3.2xlarge 或更高版本以及在 TrainingJob 的 AlgorithmSpecification 和 TrainingInputMode 中设置 MPI 或 horovod 配置来利用 SageMaker 分布式训练。权衡点包括吞吐量与成本:使用托管 Spot 实例的批量作业可降低成本,但会增加延迟和终止风险;SageMaker Pipelines 中的管道缓存可在输入未更改时减少重复的步骤启动,从而最大限度地减少不必要的计算启动时间。

常见误区与决策标准

一个常见的误区是未能集中管理预处理产物。如果在训练和推理中应用了不同的分词、NER标签映射或分类编码器,就会引入难以追踪的预测错误。应使用 Feature Store 或将预处理产物(分词器、vocab.json、label_map)与模型包一起持久化到 Model Registry 中,以便部署的容器能够检索并应用完全相同的转换。另一个常见故障是为监控捕获的数据不足:如果在端点上未启用 DataCaptureConfig 并且没有适当的真实标签标注工作流,Model Monitor 就无法计算漂移或质量指标,要弄清F1分数下降的原因就只能靠猜测。对于类别不平衡问题,操作开销最小的解决方案是使用算法支持的加权(例如 XGBoost 的 scale_pos_weight 超参数或在训练数据中提供权重列),而不是盲目地进行上采样/下采样,因为后者可能会引入采样偏差。

实践问题:用例场景

公司名称:MeridianPay。MeridianPay 必须构建一个实时的欺诈检测管道,该管道结合了 S3 中的交易日志和本地 MySQL 数据库中的客户资料。需求包括:安全的隔离存储、带有人工审批的中央模型注册表、连续训练运行时最小的启动延迟、聚合后自动进行异常检测和可视化、以最少的操作支持混合的分类和数值特征、处理类别不平衡问题,以及一个可以按需监控漂移和偏差的生产模型。

  1. 聚合和保护数据:使用 AWS DMS 将本地 MySQL 表持续复制到一个加密的 S3 落地(landing)区域,运行 AWS Glue 爬网程序,并将生成的表注册到 AWS Glue Data Catalog 中。通过 AWS Lake Formation 和 S3 桶策略强制执行访问控制;为 S3 启用一个网关 VPC 端点,并为 SageMaker 执行角色配置最小权限的 IAM。在 S3 上使用 SSE-KMS 和客户管理的 KMS 密钥,并通过 KmsMasterKeyId 设置 BucketEncryption。

  2. 转换和存储特征:在 SageMaker Data Wrangler 或 Glue ETL 作业中编写转换逻辑,将派生特征持久化到 Amazon SageMaker Feature Store 的在线存储中以供推理时低延迟查找,并存入离线存储中以供训练。将分词器/编码器产物与模型产物一起存储。使用 FeatureGroup API 创建特征组,并配置 RecordIdentifierFeatureName 和 EventTimeFeatureName 以确保时间点准确性。

  3. 以最小的运营开销进行训练:通过创建一个将 AlgorithmSpecification 指向 XGBoost 容器 URI 的 CreateTrainingJob 来使用 SageMaker XGBoost 内置容器,指定 VpcConfig 以在 VPC 中运行,传递包括 “objective”:“binary:logistic” 在内的 HyperParameters,并将 “scale_pos_weight” 设置为负样本与正样本的比例以解决类别不平衡问题。为减少重复的启动延迟,可实施 SageMaker Pipelines 并为数据准备步骤启用缓存,这样连续的管道运行就会跳过未更改的步骤;尽可能使用持久化的特征存储查找,而不是每次都重新处理。

  4. 模型注册表和人工审批:通过 CreateModelPackage 将训练好的模型注册到一个 ModelPackageGroup 中,并设置 ModelApprovalStatus=‘PendingManualApproval’。集成一个 SageMaker Pipelines CallbackStep,该步骤在 RegisterModel 之后暂停;然后由审查人员调用 UpdateModelPackage 将 ModelApprovalStatus 设置为 ‘Approved’。使用这个已批准的包进行 CreateModel 和 CreateEndpoint 配置。

  5. 异常检测和可视化:数据聚合后,使用 Amazon Lookout for Metrics 对时间序列的交易聚合数据执行自动异常检测,并配置与 S3/Glue 的集成。对于可视化,可以在 QuickSight 仪表板中连接 Lookout 的结果和数据,或使用 SageMaker Studio Notebook 来可视化特征漂移。对于已部署端点的按需模型偏差/漂移评估,在 CreateEndpoint 中启用 DataCaptureConfig,并运行一个按需的 SageMaker Clarify 处理作业(CreateProcessingJob),其 DataConfig 和 ModelConfig 指向捕获的数据;使用 Model Monitor/CreateMonitoringSchedule 来安排周期性检查,并通过 StartMonitoringSchedule 触发一次性运行。

方案解析:该方法集中了数据和转换,在能够减少运营负担的领域(如 Glue/DMS/Lookout/Comprehend/Textract)使用了托管服务,利用 SageMaker Model Registry 和 Pipelines 以最少的自定义基础设施实现版本控制和人工审批,通过算法参数解决类别不平衡问题以避免繁重的重采样,并通过 Model Monitor 和 Clarify 提供定期的和按需的偏差/漂移评估,同时保持数据加密和网络隔离。


ML 工作负载的成本优化 · 所有领域

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Amazon →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品