Модель анализа тональности имеет низкую точность валидации, и специалист по данным подозревает, что проблема заключается в очень большом словаре с низкой средней частотой слов. Какая предварительная обработка или метод лучше всего улучшит точность валидации?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Преобразовать текст в векторы признаков TF-IDF (например, с помощью TfidfVectorizer из scikit-learn)..
Почему это правильный ответ
Преобразование текста в векторы признаков TF-IDF (Term Frequency-Inverse Document Frequency) эффективно решает проблему очень большого словаря с низкой средней частотой слов. TF-IDF присваивает более высокие веса словам, которые часто встречаются в одном документе, но редко во всем корпусе, тем самым выделяя важные для конкретного документа слова и уменьшая влияние частых, но менее информативных слов. Это помогает модели лучше различать классы, улучшая точность валидации. Использование Amazon Comprehend для синтаксического анализа и обнаружения сущностей может быть полезно, но не напрямую решает проблему большого словаря и низкой частоты. Обучение с Amazon SageMaker BlazingText в режиме CBOW является методом встраивания слов, который может помочь, но TF-IDF более прямолинейно уменьшает размерность и выделяет информативные слова в данном контексте. Стемминг и удаление стоп-слов с помощью NLTK уменьшат размер словаря, но не учитывают важность слов так, как TF-IDF.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется