Amazon MLS-C01: 探索性資料分析與視覺化 — 學習指南

屬於 AWS Machine Learning Specialty MLS-C01 — 學習指南. 使用經過驗證的解答練習: Amazon 考試中心, 或參加限時模擬考試: ExamRoll.io.

分佈、轉換與特徵縮放

了解原始特徵分佈是 EDA 的基礎。首先在 SageMaker Studio 筆記本或 SageMaker Processing 任務 (使用 scikit-learn/pandas 的 ml.m5.xlarge) 中,透過直方圖、核密度估計與分位數摘要來分析每個變數的輪廓。對數轉換、Box–Cox、Yeo–Johnson 及基於排序的轉換 (分位數轉換器) 適用於右偏資料,但 Box–Cox 要求嚴格正值,遇到零值會失敗——常見的陷阱包括在沒有對零值進行平移的情況下應用對數/Box–Cox 轉換,以及在解讀模型輸出時忘記反轉轉換。在採用基於距離的方法 (k-means、PCA、SVM) 和正規化線性模型之前,標準化 (零均值、單位變異數) 是必要的;最小-最大縮放對於具有有界活化函數的神經網路很有用。部署時,應將轉換器持久化儲存在 SageMaker Feature Store 或作為模型產物,以確保線上和批次推論使用完全相同的預處理。使用 AWS Glue 或 Glue DataBrew 來分析極大型 S3 資料集的輪廓並產生摘要統計;使用 Athena 查詢分層樣本。決策標準取決於演算法的敏感度:樹狀集成模型可以容忍未經縮放的特徵,但線性及基於距離的方法則不行。最後,使用穩健統計量 (中位數、IQR) 檢查離群值和厚尾分佈,並檢視是否應進行裁剪 (clip)、縮尾 (winsorize) 或分開建模 (分群),而不是盲目地移除資料點。

殘差分析、學習曲線與診斷測試

殘差可以揭示模型的設定錯誤:必須診斷出非零均值、異質變異性、自我相關或非線性等問題。在 SageMaker Studio 中繪製殘差對預測值以及對關鍵特徵的圖;計算 Durbin–Watson 檢定自我相關性,並使用 Ljung–Box 檢定時間序列的殘差相關性。對於迴歸問題,尋找表示異質變異性的漏斗形狀;應用變異數穩定轉換或使用異質變異模型 (例如,使用調整後目標函數的 XGBoost 或機率性預測)。學習曲線——即訓練與驗證誤差對訓練集大小的關係圖——可以識別高變異 (過擬合) 或高偏差 (欠擬合)。使用 SageMaker Debugger 捕獲每個 epoch 的張量和 CloudWatch 指標,並新增一個 CloudWatch 警報,以便在訓練損失下降而驗證損失發散時觸發。常見的陷阱包括對時間序列資料使用隨機交叉驗證 (應使用基於時間的分割),以及在不平衡資料集上使用準確率進行評估 (應優先使用精確率-召回率或 AUC-PR)。對於超參數調整,應根據這些診斷來做決策:如果驗證差距持續存在,則增加正規化、增加資料或降低模型複雜度;如果兩種誤差都很高,則增加模型容量或新增特徵。透過 SageMaker Experiments 持久化儲存診斷圖表和指標,以確保可重現性。

降維、PCA、特徵分析與分群

降維可以減少雜訊並提升可詮釋性。在縮放後應用 PCA 或隨機化 SVD (在 EMR/Glue 上使用 scikit-learn 或 Spark MLlib);檢視解釋變異數比例以選擇主成分數量,並檢查負載量以將主成分對應回原始特徵。特徵向量的正負號是任意的——應解讀負載量的絕對值,並按量級將特徵分組。對於高度非線性的結構,僅使用 t-SNE 或 UMAP 進行視覺化,若無謹慎的交叉驗證,不應將其作為模型的預處理步驟。對於分群,選擇 k-means 處理球形群集 (需要縮放)、高斯混合模型進行軟性指派,以及 DBSCAN 處理基於密度的形狀;執行輪廓係數和 Davies–Bouldin 指數來進行比較。在大型資料集上,使用 SageMaker 內建的 k-means (GPU/CPU 執行個體) 或在 SageMaker Processing 中執行小批次 k-means。注意將 PCA 應用於經過獨熱編碼的類別特徵這個陷阱——應考慮使用特徵雜湊或嵌入層。使用手肘圖、解釋變異數圖以及在不同子樣本間的群集穩定性來決定 k 值。將群集中心點和 PCA 轉換器持久化儲存在 SageMaker Feature Store 中,以便下游的即時評分和基於分群的模型能使用一致的轉換。

針對模型漂移與效能的視覺化、監控及 AWS 整合

視覺化兼具探索性與營運性:在 SageMaker Studio 中使用 matplotlib/seaborn 進行臨時性繪圖,並使用 Amazon QuickSight 建立儀表板來追蹤即時效能指標。針對模型漂移與資料品質,透過 SageMaker Model Monitor 和 SageMaker Clarify,使用具代表性的訓練樣本建立基準線,以偵測分佈偏移、特徵重要性變化與偏差。使用從 Processing job 產出物衍生的基準線來設定 Model Monitor,並在已部署的端點上啟用持續監控,進行每小時/每日的檢查;CloudWatch 事件與 SNS 可觸發警報。對於串流擷取與分析,可使用 Kinesis Data Firehose 將 JSON 持久化儲存至 S3,並將格式轉換為 Parquet(啟用記錄格式轉換與 Glue Catalog 整合),或附加一個 Lambda 進行自訂轉換。若要對壓縮檔案進行近乎即時的 SQL 查詢,請在 Glue Data Catalog 中對資料進行分割與註冊,並使用 Athena 查詢,當新的 S3 物件抵達時,透過 Lambda 更新分割區。常見的陷阱包括未能對基準線進行版本控制、忽略結構演變(應使用 Glue Schema Registry),以及僅依賴彙總指標——務必納入每個特徵的漂移與每個區隔的效能,以偵測局部性的效能下降。結合使用 SageMaker Experiments 與 Model Monitor,可將超參數變更與漂移事件建立關聯,並維護血緣關係。

實務問題:使用案例情境

情境: Acme 零售商使用 AWS ML 技術堆疊,包含 SageMaker Studio、S3 資料湖、Kinesis Firehose 擷取、Glue Data Catalog,以及用於視覺化的 QuickSight。該團隊將客戶人口統計資料、會話日誌與購買記錄以 JSON 和 Parquet 格式儲存在 S3 中。

挑戰: 識別在未來六個月內最可能流失的客戶區隔,並建立監控機制以偵測特徵分佈或模型效能是否在部署後發生漂移。

建議方法:

  1. 建立一個 SageMaker Processing job (ml.m5.xlarge) 來對資料進行取樣與剖析,使用 pandas/sklearn,在適當之處應用對數/Box–Cox 轉換,並在 SageMaker Feature Store 中註冊預處理產出物。
  2. 在擴展後計算 PCA (scikit-learn 或在 Glue/EMR 上的 Spark ML) 以降低維度,檢視解釋變異量與負載量,並使用 SageMaker xgboost 或內建的 k-means 進行分群以得出區隔。
  3. 使用具備時間意識的訓練/驗證集切分來訓練一個分類模型(SageMaker 中的 XGBoost 或 TensorFlow 中的小型 NN),將指標記錄到 SageMaker Experiments,並針對不平衡資料設定提早停止與類別加權。
  4. 使用 SageMaker Endpoint 部署,並使用從 Processing job 產生的基準線啟用 Model Monitor,設定每小時的漂移檢查與 CloudWatch 警報,以透過 SNS 通知;在 QuickSight 中視覺化各區隔層級的效能與漂移。

理由: 此方法結合了穩健的預處理、可解釋的降維,以及可擴展的分群技術來進行客戶區隔,同時 SageMaker Model Monitor 與 QuickSight 提供了對資料與效能漂移的營運性偵測,透過 Feature Store 確保可重現的預處理,並透過追蹤實驗以進行根本原因分析。


資料工程與特徵工程 · 所有領域 · 模型建立 — 監督式與非監督式 (經典 ML)

練習這些題目 → · 在 ExamRoll.io 上限時練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

通過考試 →

瀏覽 Amazon →

Related guides

一站式存取

一份訂閱。所有考試。

每個方案都可無限存取答案搜尋、練習測驗、AI 解釋和完整的資源庫 — 支援 20 多種語言。

每月
24.87
Just €0.83/day
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

最佳價值
12 個月
179.87
Just €0.49/daySave 40%
包含所有內容:
  • 無限答案搜尋
  • 無限練習測驗
  • AI 驅動的解釋
  • 完整資源庫
  • 20 多種語言
  • 每週內容更新
  • 獎勵與推薦
  • 優先支援
開始免費試用

無需信用卡*

✓ 包含免費方案 · ✓ 隨時取消 · ✓ 所有方案解鎖完整產品