为了准备用于 Word2Vec 嵌入的 100 万个句子(例如:“The quck BROWN FOX jumps over the lazy dog”),应该应用哪些操作来一致地清理和准备文本?(选择三项。)
选择一个答案
点击一个选项来检查您的答案。
正确答案: 通过将所有字符转换为小写来标准化。, 使用英语停用词列表删除停用词。, 将每个句子分词为单独的单词。.
为什么这是答案
为了准备用于 Word2Vec 的文本,标准化和分词是关键步骤。将所有字符转换为小写(例如,“BROWN”变为“brown”)可以确保模型将相同单词的不同大小写形式视为相同,从而提高嵌入的质量。分词是将句子分解为单个单词的过程(例如,“The quick brown fox”变为 [“The”, “quick”, “brown”, “fox”]),这是 Word2Vec 模型处理文本的基础。删除停用词(例如,“the”、“a”、“is”)可以减少数据中的噪声,因为这些词通常不携带太多语义信息,有助于模型更专注于有意义的词。 其他选项不适合 Word2Vec 准备:词性标注并仅保留动词和名词会丢失其他词的上下文信息,影响 Word2Vec 学习词语关系的能力。修正拼写错误虽然有益,但通常不是 Word2Vec 准备的强制性或首要步骤,且可能引入复杂性。对每个单词进行独热编码是另一种表示方法,与 Word2Vec 的嵌入方法不同,Word2Vec 旨在学习密集向量表示。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 → 无需银行卡