Вы обучаете текстовый классификатор с помощью встроенного алгоритма word-embedding. Набор данных имеет пять классов со следующими количествами выборок: A=300, B=292, C=240, D=258, E=310. Вы перемешиваете и откладываете 10% для тестирования. После обучения формируются матрицы ошибок для обучающего и тестового наборов. Какой вывод можно сделать из этих результатов?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Классы C и D, вероятно, слишком похожи друг на друга..
Почему это правильный ответ
Правильный ответ — «Классы C и D, вероятно, слишком похожи друг на друга». Матрица ошибок показывает, как часто модель путает один класс с другим. Если классы C и D часто ошибочно классифицируются как друг друга, это указывает на их схожесть, что затрудняет их различение для модели. Вариант «Набор данных слишком мал для использования отложенного набора для валидации» неверен, так как 10% от выборки в 1400+ образцов (300+292+240+258+310) — это более 140 образцов, что является достаточным размером для тестового набора. Вариант «Распределение классов сильно смещено» неверен. Количество выборок в классах (A=300, B=292, C=240, D=258, E=310) достаточно сбалансировано. Вариант «Модель переобучается на классах B и E» неверен. Переобучение обычно проявляется в высокой точности на обучающем наборе и низкой на тестовом, но сама по себе матрица ошибок не даёт достаточно информации для такого вывода без сравнения с обучающей матрицей.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется