AmazonAmazon ML Engineer Associate MLA-C01 Certification
·CN
·更新于 4 Aug 2026
BrightDrive 希望用 SageMaker Serverless Inference 替换低流量的实时 GPU 端点,以节省成本。他们需要控制并发性并了解延迟权衡。以下哪项陈述最准确地描述了如何配置无服务器以及与持久实时端点相比的权衡?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 MaxConcurrency(例如 10)和适当的内存大小配置 Serverless Inference 配置;无服务器将从零开始扩展,这可能会在首次请求时产生冷启动延迟。无服务器对于间歇性流量具有成本效益,但持久实时端点提供更低、更一致的延迟,并支持 GPU 和预置容量。.
为什么这是答案
此选项准确描述了 SageMaker Serverless Inference 的配置和权衡。通过设置 MaxConcurrency 和内存大小,可以控制无服务器端点的行为。无服务器端点从零开始扩展,导致首次请求时可能出现冷启动延迟,这是其固有的特性。它适用于间歇性流量以节省成本,但对于需要低且一致延迟的场景,持久实时端点(支持 GPU 和预置容量)表现更优。
其他选项不准确:
设置 ProvisionedConcurrency 确实可以减少冷启动,但 Serverless Inference 不支持 GPU 实例类型。
Serverless Inference 具有并发设置 (MaxConcurrency),并且可以处理多个并发调用,并非仅限于串行工作负载。
切换到无服务器不能保证与实时端点相同的 p99 延迟,因为无服务器存在冷启动和潜在的扩展延迟,即使设置了 MaxConcurrency。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡