一家金融公司必須使用每日歷史資料來預測商品價格。資料科學家應該在 80% 的資料集上訓練模型,並在剩餘的 20% 上進行驗證。為了使模型比較對於時間序列預測有效,應該如何分割資料?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 選擇一個截止日期,使 80% 的資料點發生在該日期之前;使用這些較早的點進行訓練,並使用剩餘較晚的點進行驗證。.
為什麼這是答案
對於時間序列資料,必須保留資料的時間順序。正確的做法是選擇一個截止日期,將較早的資料點用於訓練,較晚的資料點用於驗證。這模擬了模型在實際預測未來事件時的行為,確保模型不會「看到」它在訓練時不應該知道的未來資訊。 選項「選擇一個截止日期,使 80% 的資料點發生在該日期之後;使用這些較晚的點進行訓練,並使用剩餘較早的點進行驗證」是錯誤的,因為這會讓模型用未來的資料來預測過去的資料,這在現實世界中是不可能發生的。 選項「從最早的日期開始,選取 8 個點進行訓練,2 個點進行驗證,並重複這種分層選擇,直到資料集用盡」是錯誤的,因為這種分層選擇會導致訓練資料和驗證資料之間的時間重疊,破壞了時間序列的獨立性。 選項「隨機抽取 80% 的資料點(不重複)進行訓練,並使用剩餘的 20% 進行驗證」是錯誤的,因為隨機抽樣會打亂時間順序,導致訓練資料中包含未來資訊,這會對時間序列預測模型的評估產生偏差。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡