데이터 과학자가 SageMaker k-means를 사용하여 고객을 분류하고 최적의 클러스터 수(k)를 선택해야 합니다. 어떤 시각화 접근 방식이 최적의 k를 가장 안정적으로 식별할 수 있을까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 다양한 k에 대해 k-means를 실행하고, 각 k에 대한 제곱 오차 합계(SSE)를 계산한 다음, SSE 대 k를 플로팅합니다. 곡선이 선형으로 감소하기 시작하는 엘보우 지점의 k를 선택합니다..
이것이 정답인 이유
정답은 엘보우 방법을 설명합니다. k-평균에서 최적의 클러스터 수(k)를 결정하는 일반적인 방법입니다. SSE(제곱 오차 합계)는 클러스터 내 분산을 측정하며, k가 증가함에 따라 SSE는 감소합니다. SSE 대 k를 플로팅할 때, 곡선이 급격히 감소하다가 완만해지는 "엘보우" 지점을 찾습니다. 이 엘보우 지점의 k가 최적의 클러스터 수로 간주됩니다.
PCA를 사용하여 시각적으로 클러스터 분리를 판단하는 것은 주관적이며 고차원 데이터에서는 신뢰하기 어렵습니다. PCA 구성 요소 수와 설명된 분산을 사용하여 k를 선택하는 것은 클러스터링 목적과 직접적인 관련이 없습니다. t-SNE는 시각화를 위한 차원 축소 기술이지만, t-SNE의 perplexity 값은 k-평균의 클러스터 수 k를 직접적으로 결정하는 데 사용되지 않습니다.