AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
FinInsights 在 ml.g5.xlarge 实例上部署了一个 JumpStart 基础模型端点,用于低延迟的金融文本生成。在成功试运行后,他们需要将持续吞吐量提高 3 倍,并保持相似的延迟尾部行为。为了满足此要求,对 SageMaker JumpStart 端点进行的最直接、受支持的更改是什么?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 更新 SageMaker 端点配置,以使用更大的 GPU 实例类型(例如,ml.g5.12xlarge),或将端点后面的实例更改为多个 ml.g5.xlarge 实例(增加实例数量)并启用端点自动扩缩。使用相同的 JumpStart 容器镜像和新的端点配置重新部署模型。.
为什么这是答案
为了将吞吐量提高三倍并保持低延迟,最直接且受支持的方法是增加端点背后的计算资源。这可以通过两种方式实现:使用更大的实例类型(例如从 ml.g5.xlarge 升级到 ml.g5.12xlarge,提供更多 GPU 资源)或增加实例数量并启用自动扩缩。这两种方法都能提供更多的 GPU 和计算能力来处理增加的请求负载。使用相同的 JumpStart 容器镜像和新的端点配置重新部署模型,可以确保在不改变模型本身的情况下应用这些基础设施更改。
其他选项不适用:
创建新的 SageMaker HyperParameterTuningJob 是用于优化模型超参数的,而不是直接增加端点吞吐量。
将 Elastic Inference 加速器附加到现有端点通常用于降低推理成本或在 CPU 实例上加速推理,而不是在已使用 GPU 实例时大幅提高吞吐量。
将端点切换到 SageMaker Serverless Inference 可能会引入不同的延迟特性,并且其自动扩缩行为可能无法保证所需的 3 倍吞吐量提升,尤其是在需要特定 GPU 资源的情况下。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡