Un scientifique des données utilisera SageMaker k-means pour segmenter les clients et doit choisir le nombre optimal de clusters (k). Quelle approche de visualisation permettra d'identifier le plus fiablement le meilleur k ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Exécuter k-means pour une plage de k, calculer la somme des erreurs quadratiques (SSE) pour chaque k, et tracer SSE en fonction de k. Choisir le k au point de coude où la courbe commence à diminuer linéairement..
Pourquoi c'est la réponse
L'approche du « coude » (Elbow Method) est une technique courante et fiable pour déterminer le nombre optimal de clusters (k) pour l'algorithme k-means. Elle consiste à exécuter k-means pour une plage de valeurs de k, à calculer la somme des carrés des erreurs (SSE) pour chaque k, puis à tracer la SSE en fonction de k. Le point de coude sur le graphique, où la diminution de la SSE commence à ralentir significativement et à devenir plus linéaire, indique généralement le k optimal. Les autres options sont moins fiables : la visualisation PCA ou t-SNE de deux composantes peut ne pas capturer toute la complexité des clusters dans des données de haute dimension, et choisir k en fonction de la variance expliquée par PCA est une méthode pour la réduction de dimensionnalité, pas pour la détermination de k-means.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise