У вас есть табличный набор данных с 10 000 строк и 1020 признаками. Отсутствуют пропущенные значения, мало дубликатов, и около 200 пар признаков имеют корреляцию > 0,9. Средние значения признаков схожи с медианами. Какой подход к конструированию признаков следует применить при обучении модели в SageMaker?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Уменьшить размерность, применив метод главных компонент (PCA)..
Почему это правильный ответ
Метод главных компонент (PCA) — это подходящий подход, поскольку он эффективно уменьшает размерность данных, сохраняя при этом большую часть дисперсии. Высокая корреляция между 200 парами признаков указывает на избыточность информации, которую PCA может устранить, создавая новые некоррелированные признаки (главные компоненты). Это улучшает производительность модели и снижает вычислительные затраты. Удаление признаков с низкой корреляцией нецелесообразно, так как эти признаки могут быть важны для модели. Обнаружение аномалий не является методом конструирования признаков. Объединение сильно коррелированных признаков вручную в Jupyter Notebook менее эффективно и масштабируемо, чем PCA, особенно при большом количестве признаков.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется