一位数据科学家将使用 SageMaker k-means 对客户进行细分,并且必须选择最佳的聚类数量 (k)。哪种可视化方法能最可靠地识别出最佳的 k 值?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 对一系列 k 值运行 k-means,计算每个 k 值的平方误差和 (SSE),并绘制 SSE 与 k 的关系图。在曲线开始线性下降的拐点处选择 k 值。.
为什么这是答案
正确答案是绘制 SSE 与 k 的关系图并选择拐点。这种方法称为“肘部法则”,它通过计算不同 k 值下的簇内平方和(SSE),然后绘制 SSE 随 k 值变化的曲线。随着 k 值的增加,SSE 会减小,但当 k 达到最佳值时,SSE 的下降速度会显著放缓,形成一个“肘部”。这个拐点通常被认为是最佳的 k 值,因为它代表了增加更多簇带来的边际收益开始递减。
其他选项的解释:
使用 PCA 散点图并主观选择分离良好的 k 值是不可靠的,因为它依赖于主观判断,并且在高维数据中,前两个 PCA 分量可能无法捕捉到所有重要的聚类结构。
将 k 等于 PCA 分量的数量与聚类数量没有直接关系,PCA 用于降维,而 k-means 旨在识别数据中的自然分组。
t-SNE 图用于可视化高维数据,而困惑度是 t-SNE 的一个参数,它与 k-means 的聚类数量 k 没有直接关系。