Редакторам нужен инструмент поиска, который возвращает статьи, где искомые слова наиболее важны и репрезентативны в корпусе документов. Исходный инструмент возвращает общие совпадения слов и требует ручной фильтрации. Какое решение позволит определить важность и частоту слов для каждого документа, чтобы инструмент выделял статьи, где искомые слова наиболее значимы?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Вычислить частоту терминов (term frequency) для каждого слова в статье (взвешенную по длине статьи) и обратную частоту документа (inverse document frequency) по всему корпусу; объединить их (например, умножить), чтобы сформировать окончательную оценку релевантности, и возвращать статьи с высокими оценками для искомых слов..
Почему это правильный ответ
Правильный ответ — это TF-IDF (Term Frequency-Inverse Document Frequency). TF-IDF — это статистическая мера, которая оценивает важность слова для документа в коллекции или корпусе. Высокое значение TF-IDF означает, что слово часто встречается в данном документе (высокая частота терминов) и редко встречается в других документах корпуса (высокая обратная частота документа), что делает его хорошим показателем релевантности. LDA (Latent Dirichlet Allocation) извлекает темы, но не напрямую оценивает важность отдельных слов для поиска. Word embeddings (встраивания слов) измеряют семантическую близость, но не частоту или уникальность слова в документе по отношению к корпусу. Простая частота терминов без IDF не учитывает общность слова в корпусе, что приводит к выдаче статей с часто встречающимися, но нерелевантными словами.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется