AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
一位工程師使用 SageMaker Data Wrangler 時,發現一個文字類別特徵有數千個因拼寫錯誤而略有不同的值。請問應該使用哪種編碼方法,才能讓處理後的特徵用於分類?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 使用相似度編碼 (similarity encoding) 來分組並表示拼寫相近的類別。.
為什麼這是答案
相似度編碼 (Similarity Encoding) 適用於處理具有大量拼寫錯誤或輕微變化的文字類別特徵。它能將相似的字串分組,並為這些群組創建新的數值表示,有效減少特徵的維度並處理資料雜訊,使模型能夠學習這些相似值之間的關係。
序數編碼 (Ordinal Encoding) 適用於具有固有順序的類別,但此處的拼寫錯誤沒有順序關係。獨熱編碼 (One-Hot Encoding) 會為每個獨特值創建一個新欄位,對於數千個獨特值會導致維度爆炸。目標編碼 (Target Encoding) 將類別替換為目標變數的統計量,雖然可以處理高基數特徵,但無法解決拼寫錯誤導致的資料雜訊問題,且可能引入資料洩漏。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡