Специалист по данным использовал SageMaker Neural Topic Model (NTM) для рекомендации тегов для записей в блоге, хранящихся в формате JSON в S3. Модель предлагает стоп-слова, такие как «a», «an» и «the», а иногда и редкие, но допустимые слова. Команда хочет сохранить редкие слова, но гарантировать, что стоп-слова не будут рекомендованы. Что должен сделать специалист по данным?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Удалить стоп-слова из текста блога с помощью CountVectorizer scikit-learn и заменить данные в S3 векторизованными результатами..
Почему это правильный ответ
Правильный ответ — удаление стоп-слов из текста блога с помощью CountVectorizer scikit-learn и замена данных в S3 векторизованными результатами. SageMaker NTM, как и многие модели обработки естественного языка, выигрывает от предварительной обработки текста. Удаление стоп-слов (например, «a», «an», «the») является стандартной практикой для улучшения качества тематического моделирования, поскольку эти слова не несут значимой информации о теме. CountVectorizer из scikit-learn позволяет не только векторизовать текст, но и удалять стоп-слова, что соответствует требованиям задачи. Вызов распознавания сущностей Amazon Comprehend не подходит, так как Comprehend предназначен для извлечения именованных сущностей, а не для удаления общих стоп-слов. Запуск встроенного алгоритма PCA SageMaker на данных блога не решит проблему стоп-слов; PCA — это метод уменьшения размерности, а не очистки текста. Использование встроенного алгоритма Object Detection SageMaker вместо NTM абсолютно неверно, поскольку Object Detection предназначен для обработки изображений, а не текста.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется