一家零售公司每位客戶的購買量很少,並且依賴許多新用戶。在分割資料以訓練和測試客製化推薦系統時,資料科學家應如何建立能反映實際使用情況的測試集?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 對於每個用戶,取出他們最近 10% 的互動,並將這些每個用戶的近期互動作為測試集。.
為什麼這是答案
正確答案是「對於每個用戶,取出他們最近 10% 的互動,並將這些每個用戶的近期互動作為測試集」。這是因為推薦系統的目標是預測未來的用戶行為。將每個用戶的最新互動保留為測試集,可以模擬實際情境中系統需要預測新購買或新互動的狀況,有效評估模型在時間序列上的預測能力。 其他選項不適合: 隨機打亂所有互動記錄並保留最後 10% 作為測試集,會導致測試集中包含舊的互動,無法有效評估模型對新行為的預測能力。 選擇互動最少的 10% 用戶或隨機選擇 10% 的用戶,並將他們所有的互動作為測試集,這會導致測試集中的用戶行為模式可能與訓練集中的用戶行為模式有很大差異,無法準確反映模型對所有用戶的泛化能力,且可能無法涵蓋足夠的未來行為預測情境。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡