Ein Data Scientist hat das SageMaker Neural Topic Model (NTM) verwendet, um Tags für Blogbeiträge zu empfehlen, die als JSON in S3 gespeichert sind. Das Modell schlägt Stoppwörter wie „a“, „an“ und „the“ sowie manchmal seltene, aber gültige Wörter vor. Das Team möchte die seltenen Wörter beibehalten, aber sicherstellen, dass keine Stoppwörter empfohlen werden. Was sollte der Data Scientist tun?
Wählen Sie eine Antwort
Tippen Sie auf eine Option, um Ihre Antwort zu überprüfen.
Richtige Antwort: Stoppwörter aus dem Blogtext mithilfe von scikit-learns CountVectorizer entfernen und die Daten in S3 durch die vektorisierten Ergebnisse ersetzen..
Warum dies die Antwort ist
Die Entfernung von Stoppwörtern ist ein Standardverfahren in der Textvorverarbeitung, um die Relevanz von Wörtern für die Analyse zu erhöhen. scikit-learns CountVectorizer bietet eine einfache und effektive Methode, um Stoppwörter zu entfernen, bevor das NTM-Modell trainiert wird. Dies stellt sicher, dass das NTM keine irrelevanten Stoppwörter als Tags vorschlägt, während seltene, aber gültige Wörter erhalten bleiben. Die Verwendung von Amazon Comprehend zur Entitätserkennung ist nicht ideal, da es darauf abzielt, benannte Entitäten zu identifizieren, nicht aber allgemeine Stoppwörter zu filtern. Der PCA-Algorithmus (Principal Component Analysis) ist eine Dimensionsreduktionstechnik, die für numerische Daten optimiert ist und nicht direkt zur Entfernung von Stoppwörtern aus Textdaten dient. Der Object Detection-Algorithmus ist für die Bildanalyse konzipiert und daher für die Verarbeitung von Blogbeiträgen ungeeignet.
Bestehen Sie Ihre Prüfung – ohne endlose Antwortsuche
Erhalten Sie jede verifizierte Frage und Erklärung für diese Prüfung an einem Ort und sparen Sie Stunden der Vorbereitung. Über 1.000 Zertifizierungen · Über 20 Sprachen · Kostenloser Start.
Bestehen Sie Ihre Prüfung schneller → Keine Karte erforderlich