Amazon AIF-C01: MLOps 與部署 — 學習指南

屬於 AWS AI Practitioner AIF-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.

部署與推論模式:即時、批次、無伺服器與邊緣

選擇推論模式時,首先要考量服務層級在延遲、吞吐量、成本和營運複雜度之間的權衡取捨。對於低延遲、高吞吐量的需求,典型的選擇是預先配置的 Amazon SageMaker 即時端點(單一模型或多模型端點),或是具備自動擴展和 GPU 執行個體的 SageMaker Real-Time Inference;可使用端點變體來實作金絲雀或藍/綠部署。對於延遲不重要的離線大型作業,SageMaker Batch Transform 或在 AWS Glue/EMR 上進行分散式處理,既具成本效益又易於擴展。對於不可預測或低 QPS 的工作負載,SageMaker Serverless Inference 或從 AWS Lambda 叫用模型(必要時搭配預置並行)可減少管理負擔和成本。邊緣部署則需要使用 SageMaker Edge Manager 封裝模型,並透過 AWS IoT Greengrass 將其分發至連線不穩定且有嚴格延遲或隱私需求的裝置。從業人員的常見陷阱包括:為稀疏流量選擇即時端點(導致高成本)、未測試無伺服器部署的冷啟動,以及低估多模型端點的記憶體/GPU 需求。決策應以 SLO(p99 延遲、吞吐量)、模型大小、並行模式和預期的更新頻率為指導;在確定託管模式之前,使用具代表性的流量進行效能分析至關重要。

模型註冊表、管線與 CI/CD 的可重複交付

一個穩健的生產工作流程會使用 SageMaker Model Registry 來對產出物進行版本控制、擷取模型血緣並管理核准工作流程,並使用 SageMaker Pipelines 來組合可重複的訓練、驗證和部署步驟。將基於 Git 的原始碼控制與 AWS CodePipeline 和 CodeBuild 整合,可實現模型程式碼的 CI:單元測試、資料結構檢查,以及自動化模型評估,作為模型晉升至註冊表的關卡。部署自動化應實作分階段的環境(開發 → 預備 → 生產),並透過端點變體、藍/綠部署或基於 Lambda 的路由來支援自動回滾或流量轉移。特徵存放區(SageMaker Feature Store)透過儲存特徵定義和時間戳記,確保訓練和推論的一致性。常見陷阱包括:未記錄超參數和環境版本、未自動化驗證測試(資料結構、效能閾值),以及缺乏不可變的產出物(應將模型產出物儲存在 S3 或 ECR 中)。應使用基礎設施即程式碼(CloudFormation 或 CDK)進行端點配置,透過鎖定函式庫和種子碼來確保可重現性,並規劃與同一個管線整合的重新訓練觸發器(資料漂移、定期排程)。

監控、Model Monitor 與營運控制

營運監控必須涵蓋資料漂移、概念漂移、效能下降、延遲和資源利用率。Amazon SageMaker Model Monitor 可以建立訓練分佈的基線,並持續分析推論流量以偵測特徵漂移、遺失值和結構變更;當有真實標籤可用時,Model Monitor 還可以追蹤預測品質和目標漂移。將推論日誌記錄到 Amazon S3 和 CloudWatch,並將日誌串流至 Amazon Kinesis 或 Amazon EventBridge 以進行即時警報和自動化管線觸發。避免常見錯誤,例如將每個漂移警報都視為重新訓練的信號——短暫的變化和季節性可能導致誤報——或在不了解自然變異的情況下設定閾值。對於不平衡的類別,應優先使用精確率、召回率和 F1 分數而非準確率,以偵測有意義的效能下降。為模型產出物實作 RBAC 和加密(KMS),使用 VPC 端點和 AWS PrivateLink 進行安全的服務存取,並透過 AWS CloudTrail 擷取稽核軌跡。維護用於修復的營運手冊:驗證資料管線、比較近期群體的效能,並進行重新訓練、回滾,或應用校準和特徵修復。

可解釋性、模型卡與符合法規的控管機制

可解釋性必須是可操作、可稽核,並且根據利害關係人的需求進行調整。Amazon SageMaker Clarify 提供訓練前偏誤檢查、訓練後偏誤指標,以及透過 SHAP 提供的逐筆預測特徵歸因,這些都可以在推論期間或以離線批次方式產生。執行時期的解釋應與預測和輸入指紋一同記錄,以提供可追溯性;將解釋儲存在 S3 中並為其建立索引以便檢索。模型卡記錄了預期用途、資料來源、在相關資料切片上的評估指標、已知限制以及效能注意事項;在 Model Registry 中維護模型卡版本以符合治理要求。金融和受監管的使用案例需要確定性的稽核軌跡:保存模型產物、超參數、評估資料和解釋日誌;針對高影響力決策實施真人參與的核准關卡,並為具挑戰性的案例維護反事實解釋。為了與託管式基礎模型安全整合,請使用 AWS PrivateLink 介面端點從 VPC 內呼叫 Amazon Bedrock,使用 KMS 加密酬載,並應用精細的 IAM 與網路控管。嵌入儲存和向量搜尋的服務選擇取決於檢索需求;根據效能和營運成本比較各種選項:

實務問題:使用案例情境

情境:FinSight 在 AWS 中營運一個信用決策流程,使用 SageMaker 進行模型訓練,使用 Bedrock 產生輔助性的生成式解釋,並使用 Amazon S3 儲存資料。模型被部署為 VPC 內的 SageMaker 即時端點,並啟用 Model Monitor 來剖析傳入的特徵。

挑戰:Model Monitor 標記出特徵偏移已超出閾值,且業務法規要求對於任何自動化的信用額度變更,都必須有可稽核、可解釋的決策。

建議方法:

  1. 使用 SageMaker Model Monitor 警示來觸發一個 EventBridge 規則,該規則會將偏移資料傳送到一個 SageMaker Pipelines 重新訓練工作流程,並將當前的推論與近期的輸入資料快照至一個 S3 隔離儲存桶。
  2. 在 SageMaker Pipelines 中執行一個自動化驗證任務,比較近期的資料分佈與基準線,計算評估指標 (精確率/召回率/F1),並使用 SageMaker Clarify 為一個具代表性的群體產生逐一樣本的 SHAP 解釋。
  3. 如果自動化檢查通過,則在 SageMaker Model Registry 中註冊新模型,並附上更新後的模型卡,其中包含效能切片和解釋;使用端點變體與流量轉移進行分階段部署。如果檢查失敗,則在維運佇列中建立一個事件,並在任何部署前啟動真人審查步驟。
  4. 對於產生人類可讀解釋的安全 Bedrock 呼叫,透過 AWS PrivateLink 路由 Bedrock 流量,並使用 KMS 加密酬載;將所有解釋輸出記錄在 S3 中,並將其與推論記錄連結以確保可稽核性。

基本原理:此方法結合了自動化偵測、可重現的驗證和受保護的部署,並具備稽核軌跡和逐筆決策的解釋——將營運控管與法規透明度對齊,並最小化錯誤的重新訓練/回滾操作。


模型訓練、評估與最佳化 · 所有領域 · AI

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Amazon →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品