AmazonAmazon ML Engineer Associate MLA-C01 Certification
·TW
·更新於 4 Aug 2026
DetectEye 營運一個詐欺模型,其中正向類別佔 0.3%,並計劃在 SageMaker 上訓練一個 XGBoost 模型。他們希望解決嚴重的類別不平衡問題,同時盡可能保留信號並避免放大標籤雜訊。在這種生產環境中,哪兩種干預措施最適合優先嘗試?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 在 SageMaker Processing job 的預處理階段,對訓練集應用 SMOTE (synthetic minority oversampling)(實作 imbalanced-learn)以增加少數類別樣本,然後再進行訓練,同時驗證合成樣本的品質。, 在 SageMaker 訓練任務中設定 XGBoost 的 scale_pos_weight(或在其他演算法中使用 class_weight),以在目標中增加正向樣本的權重,而無需更改資料集分佈。.
為什麼這是答案
選項一(SMOTE)是有效的,因為它透過合成少數類別樣本來解決極端類別不平衡問題,而不會丟棄多數類別的資訊。在預處理階段執行並驗證合成樣本品質,有助於確保模型從有意義的資料中學習,避免放大雜訊。選項三(scaleposweight/classweight)也是一個強大的技術,它透過在模型訓練期間調整少數類別的權重來解決不平衡問題,而無需實際改變資料集分佈。這兩種方法都能在保留信號的同時有效處理不平衡。
選項二(隨機欠採樣到 1:1 比例)會丟棄絕大多數多數類別數據,可能導致模型失去大量有用資訊,即使訓練速度更快,也可能犧牲模型效能。選項四(Athena 建立平衡視圖並依賴查詢時合成)不切實際,因為 Athena 是一個查詢引擎,不具備執行複雜合成演算法(如 SMOTE)的能力,且會增加查詢延遲。選項五(停用 early stopping 並提高學習率)是不正確的,因為這會增加模型過擬合的風險,並可能導致模型在不平衡資料上學習到次優模式,而不是解決類別不平衡問題。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡