一位機器學習工程師在為分類模型準備資料時,注意到有幾個連續數值特徵的值遠大於其他特徵。領域專家確認這些特徵具有資訊性,且資料集具有代表性。然而,訓練模型的準確度卻低於預期。請問哪一個預處理步驟能最有效地提高推論準確度?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 將值過大的特徵進行正規化。.
為什麼這是答案
正規化(Normalization)是將特徵值縮放到特定範圍(例如 [0, 1] 或 [-1, 1])的過程,這能有效處理不同特徵尺度差異過大的問題。當某些連續數值特徵的值遠大於其他特徵時,這些大數值特徵可能會在模型訓練中佔據主導地位,導致模型難以學習到其他特徵的影響,進而降低模型的整體準確度。正規化可以確保所有特徵對模型的貢獻更為平衡。 自助取樣(Bootstrap)是一種重採樣方法,主要用於估計統計量的變異性或構建置信區間,而非直接解決特徵尺度問題。移除值非常大的特徵會導致資訊丟失,因為領域專家已確認這些特徵具有資訊性。建立外推的合成特徵則是一種特徵工程技術,通常用於擴展資料集或捕捉非線性關係,但並非解決特徵尺度差異的首選方法。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 → 無需信用卡