Une entreprise stocke des documents dans Amazon S3, mais n'a pas de catégories de produits prédéfinies. Un data scientist doit créer un modèle pour dériver des catégories de produits pour tous les documents avec une efficacité opérationnelle maximale. Quelle solution est la plus efficace sur le plan opérationnel ?
Choisissez une réponse
Appuyez sur une option pour vérifier votre réponse.
Bonne réponse : Entraîner un modèle SageMaker Neural Topic Model (NTM) pour découvrir des catégories de produits à partir des documents..
Pourquoi c'est la réponse
La solution la plus efficace est d'entraîner un modèle SageMaker Neural Topic Model (NTM). NTM est un algorithme non supervisé conçu spécifiquement pour découvrir des sujets (catégories) latents dans une collection de documents, ce qui correspond directement au besoin de dériver des catégories de produits sans catégories prédéfinies. Il est optimisé pour la performance et l'efficacité opérationnelle sur SageMaker. La construction d'un modèle de clustering personnalisé via Dockerfile est possible mais moins efficace opérationnellement car elle demande plus d'efforts de développement et de maintenance. La tokenisation et la conversion en fonctionnalités tabulaires pour un modèle k-means est une approche valide pour le clustering, mais NTM est plus spécialisé et potentiellement plus performant pour la découverte de sujets dans le texte. BlazingText est principalement utilisé pour l'apprentissage de représentations de mots (word embeddings) ou la classification de texte, pas pour la découverte non supervisée de catégories.
Réussissez votre examen — sans la chasse aux réponses interminable
Obtenez toutes les questions et explications vérifiées pour cet examen en un seul endroit, et économisez des heures de préparation. Plus de 1 000 certifications · Plus de 20 langues · Gratuit pour commencer.
Réussissez votre examen plus rapidement → Pas de carte requise