Een data scientist gebruikte het SageMaker Neural Topic Model (NTM) om tags aan te bevelen voor blogposts die als JSON in S3 zijn opgeslagen. Het model suggereert stopwoorden zoals "a", "an" en "the", en soms zeldzame maar geldige woorden. Het team wil de zeldzame woorden behouden, maar ervoor zorgen dat stopwoorden niet worden aanbevolen. Wat moet de data scientist doen?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Stopwoorden uit de blogtekst verwijderen met behulp van scikit-learn's CountVectorizer en de data in S3 vervangen door de gevectoriseerde resultaten..
Waarom dit het antwoord is
De correcte aanpak is om stopwoorden te verwijderen voordat het NTM-model wordt getraind. Scikit-learn's CountVectorizer biedt functionaliteit om stopwoorden te filteren, wat essentieel is voor het verbeteren van de kwaliteit van topic modeling. Door dit te doen, zullen veelvoorkomende, oninformatieve woorden zoals "a", "an" en "the" niet langer als tags worden voorgesteld, terwijl zeldzame, maar relevante woorden behouden blijven. Het vervangen van de data in S3 met de opgeschoonde, gevectoriseerde resultaten zorgt ervoor dat het NTM-model traint op relevante input. De andere opties zijn incorrect: Amazon Comprehend entity recognition is gericht op het identificeren van entiteiten (personen, locaties, organisaties) en niet op het verwijderen van algemene stopwoorden voor topic modeling. Het PCA-algoritme is een dimensionaliteitsreductietechniek en is niet ontworpen voor het filteren van stopwoorden of het voorbereiden van tekst voor topic modeling. Het Object Detection-algoritme is bedoeld voor beeldanalyse en is niet relevant voor tekstuele data zoals blogposts.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig