AmazonAmazon Machine Learning Specialty MLS-C01
·TW
·更新於 26 Jul 2026
一位資料科學家將使用 SageMaker k-means 來區隔客戶,並且必須選擇最佳的叢集數量 (k)。哪種視覺化方法能最可靠地識別出最佳的 k 值?
選擇一個答案
點擊一個選項來檢查您的答案。
正確答案: 針對一系列的 k 值執行 k-means,計算每個 k 值的平方誤差和 (SSE),並繪製 SSE 與 k 值的關係圖。在曲線開始呈線性下降的拐點處選擇 k 值。.
為什麼這是答案
肘部法則 (Elbow Method) 透過繪製不同 k 值下的平方誤差和 (SSE),來識別最佳的 k 值。SSE 衡量每個點到其所屬叢集中心的距離平方和。隨著 k 值增加,SSE 通常會減少,因為資料點離其叢集中心更近。肘部點是 SSE 顯著下降趨勢開始變緩的點,表示再增加叢集數量所帶來的邊際效益遞減,因此該點的 k 值通常被認為是最佳選擇。
其他選項的錯誤原因:
PCA 散佈圖:僅使用前兩個 PCA 元件會丟失大量資訊,可能無法準確反映真實的叢集結構。
PCA 解釋變異數圖:此圖用於確定保留多少 PCA 元件以解釋足夠的變異數,而非直接選擇 k-means 的 k 值。
t-SNE 困惑度圖:t-SNE 是一種降維技術,困惑度是其參數,用於平衡局部和全局結構的保留,但它不直接用於選擇 k-means 的最佳 k 值。
通過考試 — 無需無休止地尋找答案
集中一處獲取此考試的所有核實題目和解釋,節省數小時的準備時間。1,000 多種認證 · 20 多種語言 · 免費開始。
更快通過您的考試 →
無需信用卡