Используя SageMaker Data Wrangler, инженер обнаруживает текстовый категориальный признак с тысячами немного отличающихся значений, вызванных орфографическими ошибками. Какой метод кодирования следует использовать, чтобы обработанный признак можно было использовать для классификации?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Использовать кодирование по сходству (similarity encoding) для группировки и представления схожих по написанию категорий..
Почему это правильный ответ
Кодирование по сходству (similarity encoding) — это наиболее подходящий метод, поскольку оно специально разработано для обработки текстовых категориальных признаков с большим количеством похожих, но не идентичных значений, таких как те, которые вызваны опечатками. Оно группирует похожие значения, создавая более надежное представление для моделей машинного обучения. Порядковое кодирование (ordinal encoding) присваивает числовые значения категориям на основе их порядка, что неприменимо, когда нет естественного порядка. One-hot кодирование создаст слишком много разреженных признаков для тысяч уникальных значений, что приведет к проклятию размерности. Целевое кодирование (target encoding) заменяет категории статистикой целевой переменной, но не решает проблему опечаток и может привести к утечке данных.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется