RetailVision 拥有 240 个门店个性化模型(每个模型约 120 MB),这些模型被查询的频率较低(每个模型请求之间间隔数分钟)。他们目前将每个模型作为单独的 endpoint 进行托管,这导致成本很高。他们希望进行整合以最大限度地降低成本,同时在首次请求模型时保持可接受的冷启动延迟。在这种情况下,哪种 SageMaker 托管方法最能降低成本?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用单个 SageMaker 多模型 endpoint,将模型工件存储在 S3 中;容器将按需将模型加载到内存中,将许多低流量模型整合到更少的实例上——确保实例内存足以容纳同时活动的模型,并接受偶尔的模型加载延迟.
为什么这是答案
正确答案是使用单个 SageMaker 多模型 endpoint,将模型工件存储在 S3 中,按需加载模型。这种方法通过将多个低流量模型整合到更少的实例上,显著降低了成本,因为您只需为共享实例付费,而不是为每个模型单独的 endpoint 付费。模型按需从 S3 加载,避免了在内存中保留所有模型的资源浪费,同时在首次请求时接受可接受的冷启动延迟。 其他选项不理想: 用 EC2 实例替换 SageMaker endpoint 会增加管理开销,并且将所有 240 个模型加载到内存中会非常昂贵且效率低下。 使用 240 个不同的多容器实时 endpoint 并自动扩缩到零,虽然可以节省成本,但每个模型仍然有独立的 endpoint 开销,并且每次扩缩都会有冷启动延迟。 对每个模型使用 SageMaker Asynchronous Inference 并保留一个单独的 endpoint,配置最小并发数为 1,这会为每个模型产生持续的实例成本,无法有效降低总成本。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡