Amazon AIF-C01: AI/ML 的成本优化与定价 — 学习指南

属于 AWS AI Practitioner AIF-C01 — 学习指南. 使用经过验证的答案练习: Amazon 考试中心, 或参加限时模拟考试: ExamRoll.io.

Bedrock、SageMaker 和 EC2 的成本驱动因素与定价模型

AI/ML 工作负载的定价分为计算、存储、网络和特定于服务的计量方式。通过 Amazon Bedrock 访问基础模型,对于文本工作负载通常按请求或按 token 计费,对于流式 API 则按秒计费;SageMaker 对训练和多租户托管收取实例小时费用,外加数据传输和存储费用。基于 EC2 的托管会产生原始的实例小时成本,并附带额外的 EBS、EFS 或 FSx 存储费用以及 VPC 出口流量费用。关键的成本驱动因素包括模型大小(更大的模型会增加 token/数学运算量和内存占用)、推理吞吐量(固定在昂贵 GPU 上的延迟敏感型同步调用成本更高),以及用于检索增强生成 (RAG) 的数据移动,其中嵌入查找和向量搜索会使调用次数成倍增加。从业者常见的陷阱包括:低估高 QPS 的 RAG 系统的嵌入成本、让多个空闲的 SageMaker 端点持续运行,以及在将 PII 保留在区域内时忽略跨区域的出口流量。因此,决策标准应考虑请求量、单次请求的延迟容忍度、模型是否必须进行微调或可保持现成状态,以及在考虑管理和扩展开销后,是提供商托管的推理(Bedrock/SageMaker 端点)还是自托管的 EC2/GPU 实例能提供更好的 TCO。

实例选择、Spot 实例和计算优化模式

选择实例会同时影响性能和成本。对于训练,当大规模矩阵吞吐量至关重要时,应使用 Trainium (trn1) 或 GPU 集群 (p4/p5);对于推理,为降低成本,应优先选择 Inferentia/Inf2 (inf1/inf2) 或基于 Graviton 的 CPU 来处理较小的模型。像 SageMaker Managed Spot Training 和 SageMaker Distributed Training 这样的托管服务集成了检查点机制,并能自动回收 Spot 容量,从而大幅降低训练成本;然而,对于低延迟的生产环境,除非结合了稳健的回退机制,否则使用 Spot 实例是一个陷阱。能够减少开销的架构模式包括:异步批处理、带有冷启动保护的自动扩展、用于将多个小模型整合到单个主机上的多模型端点,以及使用混合精度和量化来削减内存和吞吐量需求。使用 DeepSpeed 或 ZeRO 等框架来降低大模型训练的内存占用,并评估参数高效微调(LoRA/适配器)以避免完整的模型重训练。一个常见的错误是,在以嵌入为主的工作负载上使用顶级 GPU,而实际上 CPU 或 Inferentia 实例能够提供远超其右的性价比。

模型选择的权衡与成本感知策略

模型选择是在成本、延迟、准确性和数据敏感性之间进行的权衡。Bedrock 中的基础模型提供托管扩展、安全工具和快速迭代,但会产生按调用或按 token 计算的成本,在规模化时这部分成本可能占主导地位;如果能够分摊托管和运维开销,托管在 SageMaker 或 EC2 上的开源模型可以降低单次推理的费用。混合架构效果很好:用一个小型、廉价的模型处理大部分请求,对复杂查询则升级到更大的模型;或者使用检索增强生成,其中繁重的上下文由向量存储(OpenSearch、由 Amazon QLDB 支持的向量数据库或第三方服务)提供,只将简洁的提示发送给 LLM。微调决策应考虑参数高效方法(LoRA、适配器)以及用于文本到文本任务的 JSONL 格式的提示-完成对,以限制数据集和计算资源的使用。常见的陷阱包括:在不必要时微调大型模型而不是使用提示工程、忽略提示 token 长度膨胀的问题,以及不对高重复性查询的响应进行缓存或去重。

用于成本控制的存储、数据本地化、治理与可观测性

存储选择既影响月度成本,也关系到法律合规性。对数据集使用 S3,并配合生命周期策略、Intelligent-Tiering 和压缩格式(Parquet/TFRecord);将活跃的训练数据暂存到高吞吐量层,并将原始资产归档到 Glacier。对于 PII 和数据驻留要求,请将 S3 存储桶、KMS 密钥和计算资源保留在所需的 AWS 区域内,并通过 VPC 端点、IAM 策略和私有网络来控制访问,以防止意外的跨区域数据流出。用于 RAG 的检索管道应将向量存储(Amazon OpenSearch Service 或 EC2/EBS 上的嵌入存储)与推理层部署在同一位置,以避免传输成本和延迟。SageMaker Clarify、Debugger 和 Model Monitor 等可观测性和可解释性工具可以实现治理和早期漂移检测,但会增加成本——应部署基于采样的监控器以控制开销。通过选择高效芯片(Inferentia/Trainium)和批处理来最大限度地减少环境足迹和账单;一个常见的错误是在没有设置采样阈值的情况下启用完整的日志记录和持续的模型监控,这会增加成本和噪音,但提供的增量价值却很小。

实践问题:用例场景

场景:Acme Retail 公司运行着一个 AWS AI 技术栈,使用 Amazon Bedrock 访问 LLM,使用 Amazon SageMaker 进行模型训练/托管,使用 S3 存储数据,并使用 Amazon OpenSearch 进行产品索引。他们必须每天生成数千个段落长度的产品描述,同时要保持一致的品牌声誉、满足严格的区域内 PII 要求,并控制在紧张的成本目标内。

挑战:大规模交付高质量、符合品牌形象的描述,同时最大限度地降低单次描述的成本,并确保客户数据永远不会离开指定的 AWS 区域。

推荐方法:

  1. 使用双层推理管道:首先将所有请求路由到在 SageMaker 或 EC2 上托管的轻量级本地模型(量化版),以处理常见的 SKU 和简单的描述;将复杂或低置信度的案例上报给 Bedrock 基础模型。
  2. 将嵌入和检索索引存储在区域内的 Amazon OpenSearch 中;使用简洁的检索上下文来保持 Bedrock 的 token 使用量在较低水平,并在 ElastiCache 中缓存常见响应。
  3. 使用参数高效方法 (LoRA) 在 SageMaker Managed Spot Training 上微调一个小型专用模型,并将检查点保存到 S3,从而减少完整的模型重新训练频率。
  4. 强制执行区域边界控制:将 S3 存储桶和 KMS 密钥置于区域内,为 Bedrock/SageMaker 设置 VPC 端点,并使用基于采样的 Model Monitor + Clarify 来限制监控成本。

基本原理:将廉价的基线模型与选择性上报相结合,可以最大限度地降低每次描述的 token 和实例成本,而 RAG 和缓存则减少了对 Bedrock 的调用。托管 Spot 训练和参数高效微调降低了训练费用和存储开销,同时区域内控制满足了 PII 和合规性要求。


MLOps 与部署 · 所有领域

练习这些题目 → · 在 ExamRoll.io 上限时练习 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通过考试 →

浏览 Amazon →

Related guides

一体化访问

一次订阅。所有考试。

所有计划均可无限制搜索答案、进行模拟测试、获取AI解释以及访问完整的资源库 — 支持20多种语言。

每月
24.87
Just €0.83/day
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

最具价值
12个月
179.87
Just €0.49/daySave 40%
包含所有内容:
  • 无限答案搜索
  • 无限模拟测试
  • AI驱动的解释
  • 完整资源库
  • 20多种语言
  • 每周内容更新
  • 奖励与推荐
  • 优先支持
开始免费试用

无需信用卡*

✓ 包含免费计划 · ✓ 随时取消 · ✓ 所有计划均解锁完整产品