Een sentimentanalysemodel heeft een lage validatienauwkeurigheid en de data scientist vermoedt dat een zeer grote woordenschat met een lage gemiddelde woordfrequentie het probleem is. Welke voorverwerking of methode zou de validatienauwkeurigheid het beste verbeteren?
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Converteer tekst naar TF-IDF feature vectors (bijvoorbeeld met scikit-learn's TfidfVectorizer)..
Waarom dit het antwoord is
De lage validatienauwkeurigheid en de grote woordenschat met lage woordfrequentie duiden op een probleem met sparse data en de aanwezigheid van veel irrelevante woorden. TF-IDF (Term Frequency-Inverse Document Frequency) is een effectieve techniek om de belangrijkheid van woorden in een document te wegen ten opzichte van een corpus. Het vermindert de impact van veelvoorkomende, minder informatieve woorden (zoals stopwoorden) en benadrukt zeldzamere, meer onderscheidende termen. Dit helpt de dimensionaliteit te verminderen en de relevantie van features te verbeteren, wat de nauwkeurigheid van het sentimentanalysemodel verhoogt. Andere opties zijn minder geschikt: Amazon Comprehend is een kant-en-klare dienst, geen voorverwerkingstechniek om de genoemde problemen direct aan te pakken. BlazingText in CBOW-modus is een woordembeddingstechniek, nuttig voor het vastleggen van semantische relaties, maar lost het probleem van een te grote, sparse woordenschat niet direct op. Stemming en het verwijderen van stopwoorden zijn nuttige voorverwerkingsstappen, maar TF-IDF omvat een soortgelijke functionaliteit (door de weging) en is krachtiger in het omgaan met de specificiteit van het probleem (lage gemiddelde woordfrequentie).
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig