AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
FinInsights 在 ml.g5.xlarge 實例上部署了一個 JumpStart 基礎模型端點,用於低延遲的金融文本生成。在成功試點後,他們需要將持續吞吐量提高 3 倍,並保持相似的延遲尾部行為。為了滿足此要求,對 SageMaker JumpStart 端點進行最直接且受支援的更改是什麼?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 更新 SageMaker 端點配置以使用更大的 GPU 實例類型(例如 ml.g5.12xlarge),或更改為端點後方的多個 ml.g5.xlarge 實例(增加實例數量)並啟用端點自動擴展。使用相同的 JumpStart 容器映像和新的端點配置重新部署模型。.
為什麼這是答案
正確答案是更新 SageMaker 端點配置以使用更大的 GPU 實例類型或增加實例數量並啟用自動擴展。這是最直接且受支援的方法,因為它直接解決了增加吞吐量的需求,同時透過更大的實例或多個實例來維持低延遲。重新部署模型是必要的,因為端點配置已更改。
其他選項不正確:
創建新的 SageMaker HyperParameterTuningJob 不會直接增加端點的吞吐量,它主要用於模型訓練優化,而不是端點擴展。
將 Elastic Inference 加速器連接到現有端點通常用於降低推理成本,而不是顯著提高吞吐量,特別是在需要 3 倍吞吐量增加的情況下。
將端點切換到 SageMaker Serverless Inference 可能會增加吞吐量,但它通常會引入更高的延遲變動,這與保持「相似的延遲尾部行為」的要求相悖。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡