AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
PowerGrid Inc 訓練一個模型,用於預測儲存在 S3 資料湖中多年的每小時電力負載,並使用 SageMaker Processing job 進行特徵工程。該團隊考慮在 SageMaker 上進行超參數調整時使用標準的 k-fold (scikit-learn KFold with shuffle=False) 交叉驗證,但擔心時間洩漏 (temporal leakage)。哪種驗證策略和 SageMaker 整合是避免洩漏同時支援穩健超參數調整的最佳實踐?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 實作 walk-forward (rolling-origin) 驗證,以多個 SageMaker Training job (每個 fold 一個) 或基於 SageMaker Processing 的協調方式實作,確保每個 fold 僅在過去的資料上進行訓練,並在未來的時間窗上進行驗證。.
為什麼這是答案
對於時間序列資料,walk-forward (rolling-origin) 驗證是避免時間洩漏的最佳實踐。它透過確保每個訓練集只包含過去的資料,並在隨後的未來時間窗上進行驗證,來模擬真實世界的預測場景。這可以透過多個 SageMaker Training job 或 SageMaker Processing job 來協調實現,以有效管理資料分割和模型訓練。
標準的 k-fold CV (即使 shuffle=False) 不適用於時間序列,因為它可能會將未來的資料點包含在訓練集中,導致時間洩漏。留一法交叉驗證 (LOO) 計算成本高昂,且對於時間序列資料同樣不適用,因為它沒有考慮時間順序。單一的保留驗證分割雖然避免了時間洩漏,但它只提供單一的性能評估,無法像交叉驗證那樣提供穩健的超參數調整。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡