运行内置图像分类模型(在 ml.m5.xlarge 实例上)的 SageMaker 端点遇到了不可接受的推理延迟,其中 ModelLatency 是主要因素。当多个用户并发调用端点时,延迟会加剧。哪项措施可以减少这些研究人员的推理延迟?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 将 Amazon Elastic Inference 加速器(例如 ml.eia2.medium)附加到端点实例。.
为什么这是答案
当推理延迟(尤其是模型延迟)成为瓶颈时,通常意味着计算资源不足以快速处理模型。Amazon Elastic Inference (EI) 加速器专门设计用于在不使用昂贵的完整 GPU 实例的情况下加速深度学习推理。通过将 EI 加速器附加到现有实例,可以显著提高推理吞吐量和降低延迟。 其他选项: 切换到 ml.t3 可突增实例通常会降低性能,因为它们的基础性能低于 ml.m5 实例,并且突增能力在持续高负载下会耗尽。 SageMaker Autopilot 专注于自动调优模型以提高准确性,而不是直接解决部署时的推理延迟问题。 更改为内存优化实例类型(如 R 系列)主要解决内存密集型工作负载,而不是计算密集型推理延迟问题。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡