Специалисту по данным необходимо провести первоначальный исследовательский анализ комментариев клиентов с использованием диаграмм и облака слов, а также применить feature engineering перед построением модели NLP. Какие две техники feature engineering следует использовать для подготовки текста к визуализации и моделированию? (Выберите два.)
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Stemming, Term frequency–inverse document frequency (TF‑IDF).
Почему это правильный ответ
Стемминг (Stemming) — это процесс сокращения слов до их корневой формы (основы). Это помогает уменьшить количество уникальных слов, что упрощает визуализацию (например, в облаках слов) и улучшает обобщающую способность моделей, поскольку слова с одинаковым корнем (например, "бег", "бежать", "бежит") рассматриваются как одно целое. TF-IDF (Term Frequency–Inverse Document Frequency) — это статистическая мера, которая отражает важность слова в документе или корпусе документов. Она учитывает, как часто слово встречается в конкретном документе (TF), и насколько оно уникально для всего корпуса (IDF). Это позволяет выделить наиболее значимые слова, что критически важно для визуализации (например, для определения размера слов в облаке слов) и для создания информативных признаков для моделей NLP, поскольку общие слова (например, "и", "в") получают низкий вес. Named Entity Recognition (NER) и Coreference Resolution являются более сложными задачами NLP, которые извлекают сущности или разрешают местоимения, но не являются основными техниками feature engineering для базовой визуализации или подготовки текста. Sentiment Analysis — это задача классификации, а не техника feature engineering для подготовки текста.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется