一位数据科学家必须使用图表和词云对客户评论进行初步探索性分析,并希望在构建 NLP 模型之前应用特征工程。应该使用哪两种特征工程技术来准备文本以进行可视化和建模?(选择两项。)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 词干提取, 词频-逆文档频率 (TF-IDF).
为什么这是答案
词干提取(Stemming)通过将单词还原为其词根形式来减少词汇的复杂性,例如将“running”和“ran”都变为“run”。这有助于在词云中聚合相关词语,并在建模前减少特征维度。词频-逆文档频率(TF-IDF)是一种统计方法,用于评估一个词语对于一个文档集或一个语料库中的其中一份文档的重要程度。它能识别出对特定文档具有区分度的词语,这对于可视化(例如突出关键词)和后续的NLP模型构建都非常有用。命名实体识别和共指消解是更高级的NLP任务,主要用于信息抽取和理解,而非直接的特征工程以准备可视化和建模。情感分析是文本分类的一种应用,而非特征工程技术本身。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡