在P3实例上运行内置对象检测模型的生产SageMaker实时端点显示GPU利用率较低。哪种部署更改能更好地利用已预置的推理资源?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 在M5实例上重新部署模型并附加Amazon Elastic Inference加速器。.
为什么这是答案
在P3实例上GPU利用率低,意味着GPU资源未被充分利用。将模型重新部署到M5实例并附加Amazon Elastic Inference加速器是更经济高效的解决方案。Elastic Inference允许您为CPU实例(如M5)添加适量的GPU加速,从而提高推理性能,同时避免了预置整个GPU实例的成本。 切换到批量转换作业适用于离线或非实时推理,不符合实时端点的需求。迁移到更大的GPU实例(如P3dn)会进一步增加成本,且可能无法解决低利用率问题,因为问题可能在于模型本身对GPU资源的利用效率。在Amazon ECS集群上托管模型虽然提供了容器化和编排能力,但如果仍然使用P3实例,并不能直接解决GPU利用率低的问题,反而可能增加管理复杂性。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡