您正在建立一個迴歸模型來預測病患的預後。在一個包含 4,000 名病患(所有病患都超過 65 歲)的資料集中,有 450 筆記錄的年齡被記錄為 0,而其他特徵看起來都合理。您應該如何處理這些不正確的年齡值?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將年齡值為 0 的記錄替換為資料集的平均年齡或中位數年齡。.
為什麼這是答案
由於所有病患都超過 65 歲,年齡為 0 的記錄顯然是資料輸入錯誤。將這些不正確的值替換為資料集的平均年齡或中位數年齡是一種常見且有效的遺失值處理方法,可以保留資料集中的大部分資訊,同時糾正錯誤。移除所有年齡等於 0 的記錄會導致資料損失,特別是當這些記錄佔總資料集相當大的比例時(此處為 450/4000 = 11.25%)。完全捨棄年齡特徵會失去一個可能對預測病患預後很重要的特徵。使用 k-means 叢集來估算遺失值通常用於處理真正的遺失值,而不是明顯的輸入錯誤,且對於單一特徵的簡單錯誤修正而言過於複雜。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡