Un modèle d'analyse des sentiments a une faible précision de validation, et le scientifique des données soupçonne qu'un vocabulaire très large avec une faible fréquence moyenne des mots est le problème. Quel prétraitement ou quelle méthode améliorerait le mieux la précision de la validation ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Convertir le texte en vecteurs de caractéristiques TF-IDF (par exemple, en utilisant TfidfVectorizer de scikit-learn)..
Pourquoi c'est la réponse
La conversion du texte en vecteurs TF-IDF est une technique efficace pour gérer un vocabulaire large avec une faible fréquence moyenne des mots. TF-IDF pondère l'importance des mots en fonction de leur fréquence dans un document et de leur rareté dans l'ensemble du corpus, réduisant ainsi l'impact des mots courants et augmentant celui des mots distinctifs. Cela permet au modèle de mieux se concentrer sur les termes pertinents pour l'analyse des sentiments, améliorant ainsi la précision de la validation. L'utilisation d'Amazon Comprehend est une solution de service géré, pas une méthode de prétraitement pour un modèle personnalisé. L'entraînement avec SageMaker BlazingText en mode CBOW est une méthode d'intégration de mots (word embedding), mais ne gère pas directement la problématique de la fréquence des mots comme le fait TF-IDF. La racinisation et la suppression des mots vides réduisent la taille du vocabulaire mais ne pondèrent pas l'importance des mots rares ou fréquents de la même manière que TF-IDF.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise