AmazonAmazon Machine Learning Specialty MLS-C01
·TW
·更新於 26 Jul 2026
一個經過清理的資料集,其特徵的尺度差異高達數個數量級。為了在生產環境中最大化預測準確度,在建立模型之前,您應該遵循哪個步驟序列?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將資料集分割成訓練集、驗證集和測試集,然後重新縮放訓練集,並將相同的縮放參數應用於驗證集和測試集。.
為什麼這是答案
正確的步驟是先將資料集分割成訓練集、驗證集和測試集,然後僅在訓練集上執行重新縮放。這是因為重新縮放(例如標準化或正規化)是從資料中學習轉換參數的過程。如果我們在分割資料之前對整個資料集進行重新縮放,那麼測試集和驗證集將會「看到」訓練集中的資訊,導致資料洩漏 (data leakage),這會使模型在未見過的新資料上的表現評估不準確。因此,在訓練集上學習縮放參數後,必須將這些相同的參數應用於驗證集和測試集,以確保資料的一致性並模擬真實世界的部署情境。選項A的隨機抽樣不是必要的預處理步驟。選項C會導致資料洩漏。選項D會對每個集合應用不同的縮放參數,這會破壞資料的一致性。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡