AmazonAmazon Machine Learning Specialty MLS-C01
·CN
·更新于 26 Jul 2026
一位数据科学家使用 SageMaker Neural Topic Model (NTM) 为存储在 S3 中的 JSON 格式博客文章推荐标签。该模型会推荐“a”、“an”和“the”等停用词,有时也会推荐一些罕见但有效的词。团队希望保留罕见的词,但确保不推荐停用词。数据科学家应该怎么做?
选择一个答案
点击一个选项来检查您的答案。
正确答案: 使用 scikit-learn 的 CountVectorizer 从博客文本中删除停用词,并用向量化结果替换 S3 中的数据。.
为什么这是答案
正确答案是使用 scikit-learn 的 CountVectorizer 从博客文本中删除停用词,并用向量化结果替换 S3 中的数据。CountVectorizer 允许在词汇表创建期间指定停用词列表,从而有效地在模型训练前从数据中移除这些词,同时保留其他词。
选项一不正确,因为 Amazon Comprehend 的实体识别主要用于识别命名实体,而不是通用停用词,并且直接修改 S3 中的原始数据可能不是最佳实践。选项二不正确,因为 SageMaker 内置的 PCA 算法是降维技术,不适用于文本预处理中的停用词去除。选项三不正确,因为 SageMaker 内置的 Object Detection 算法用于图像识别,与文本主题建模无关。
通过考试 — 无需无休止地寻找答案
将本次考试的所有验证问题和解释集中在一处,节省数小时的准备时间。1,000+ 认证 · 20+ 语言 · 免费开始。
更快通过考试 →
无需银行卡