Pour préparer 1 million de phrases pour les embeddings Word2Vec (exemple : « The quck BROWN FOX jumps over the lazy dog »), quelles opérations doivent être appliquées pour nettoyer et préparer le texte de manière cohérente ? (Choisissez-en trois.)
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Normaliser en convertissant tous les caractères en minuscules., Supprimer les mots vides (stop words) en utilisant une liste de mots vides anglais., Tokeniser chaque phrase en mots individuels..
Pourquoi c'est la réponse
Pour préparer du texte pour Word2Vec, la tokenisation est essentielle car elle divise le texte en unités significatives (mots), ce qui est la base des embeddings. La normalisation en minuscules réduit la variabilité, traitant "The" et "the" comme le même mot, ce qui améliore la cohérence des embeddings. La suppression des mots vides (stop words) comme "the", "a", "is" est cruciale car ces mots fréquents n'apportent généralement pas beaucoup d'informations sémantiques et peuvent diluer la signification des embeddings des mots plus importants. Le balisage de partie du discours et la conservation de seulement certains types de mots sont trop restrictifs pour Word2Vec, qui bénéficie d'un contexte plus large. La correction orthographique est utile mais n'est pas une étape fondamentale pour la préparation initiale du texte pour Word2Vec, bien qu'elle puisse améliorer la qualité des embeddings. L'encodage one-hot n'est pas une étape de préparation pour Word2Vec ; c'est une méthode de représentation des mots qui est généralement remplacée par les embeddings de Word2Vec eux-mêmes.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise