En utilisant SageMaker Data Wrangler, un ingénieur trouve une caractéristique catégorielle textuelle avec des milliers de valeurs légèrement différentes causées par des fautes d'orthographe. Quelle méthode d'encodage devrait être utilisée pour que la caractéristique traitée puisse être utilisée pour la classification ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Utiliser l'encodage de similarité pour regrouper et représenter les catégories dont l'orthographe est proche..
Pourquoi c'est la réponse
L'encodage de similarité est la méthode la plus appropriée car il est conçu pour gérer les variations textuelles et les fautes d'orthographe en regroupant les valeurs similaires. Cela réduit le nombre de catégories uniques et améliore la qualité des données pour les modèles de classification. L'encodage ordinal attribue un ordre aux catégories, ce qui n'est pas pertinent ici et pourrait introduire un biais. L'encodage one-hot créerait un nombre excessif de colonnes pour des milliers de valeurs légèrement différentes, ce qui rendrait le modèle inefficace et difficile à entraîner. L'encodage cible utilise des statistiques de la variable cible, ce qui n'est pas l'objectif principal ici et ne résoudrait pas le problème des fautes d'orthographe.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise