一家媒体公司需要为某个城市的读者提供低延迟的文章推荐。流量高峰出现在可预测的时间(早上、午餐、下班后),其他时间流量较少。推理响应小于 4 MB。哪种部署方案能最大限度地降低延迟且最具成本效益?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用预置并发的无服务器推理,以最大限度地降低冷启动延迟。.
为什么这是答案
预置并发的无服务器推理(例如使用 AWS Lambda)是最佳选择。它通过预热函数实例来消除冷启动延迟,确保在可预测的流量高峰期提供低延迟响应。无服务器架构按需付费,在非高峰时段自动缩减,从而实现成本效益。实时推理端点(如 SageMaker Endpoint)虽然提供低延迟,但自动扩缩可能需要时间响应流量激增,且在低流量时段可能成本较高。异步推理和批处理转换作业不适合需要低延迟实时推荐的场景,因为它们本质上是批处理或基于队列的。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡