Een data scientist moet een eerste verkennende analyse van klantopmerkingen produceren met behulp van grafieken en een word cloud, en wil feature engineering toepassen voordat een NLP-model wordt gebouwd. Welke twee feature-engineering technieken moeten worden gebruikt om tekst voor te bereiden voor visualisatie en modellering? (Kies twee.)
Kies een antwoord
Tik op een optie om je antwoord te controleren.
Correct antwoord: Stemming, Term frequency–inverse document frequency (TF‑IDF).
Waarom dit het antwoord is
Stemming reduceert woorden tot hun stamvorm (bijv. "rennen", "rent", "rende" worden "ren"), wat helpt bij het groeperen van vergelijkbare termen voor visualisatie (zoals word clouds) en het verminderen van de dimensionaliteit voor modellen. TF-IDF kwantificeert het belang van een woord in een document ten opzichte van een corpus, wat essentieel is voor het voorbereiden van tekstdata voor machine learning-modellen door woorden om te zetten in numerieke vectoren. Named entity recognition en sentiment analysis zijn geavanceerdere NLP-taken die vaak na de initiële feature engineering plaatsvinden. Coreference resolution lost verwijzingen naar dezelfde entiteit op (bijv. "Jan zei dat hij kwam"), wat nuttig is voor diepgaande analyse, maar minder direct voor algemene visualisatie en de basis voorbereiding.
Slaag voor je examen — zonder eindeloos zoeken naar antwoorden
Krijg elke geverifieerde vraag en uitleg voor dit examen op één plek, en bespaar uren voorbereiding. Meer dan 1.000 certificeringen · Meer dan 20 talen · gratis om te beginnen.
Slaag sneller voor je examen → Geen kaart nodig