PowerGrid Inc обучает модель для прогнозирования почасовой нагрузки на электроэнергию на несколько лет, хранящуюся в озере данных S3, и использует задания SageMaker Processing для извлечения признаков. Команда рассматривала возможность использования стандартной k-кратной перекрестной проверки (scikit-learn KFold с shuffle=False) во время настройки гиперпараметров в SageMaker, но беспокоится о временной утечке. Какая стратегия проверки и интеграция с SageMaker является лучшей практикой для предотвращения утечки при поддержке надежной настройки гиперпараметров?
Выберите ответ
Нажмите на вариант, чтобы проверить свой ответ.
Правильный ответ: Реализовать скользящую (rolling-origin) валидацию, реализованную как несколько SageMaker Training jobs (по одному на фолд) или оркестрацию на основе SageMaker Processing, гарантируя, что каждый фолд обучается только на прошлых данных и валидируется на будущих окнах..
Почему это правильный ответ
Правильный ответ — скользящая (rolling-origin) валидация, реализованная как несколько заданий SageMaker Training или оркестрация на основе SageMaker Processing. Это предотвращает утечку данных, обучая каждую модель только на прошлых данных и оценивая ее на будущих окнах, что критически важно для временных рядов. Стандартная k-кратная кросс-валидация со shuffle=False не эквивалентна кросс-валидации временных рядов, так как она все равно может использовать будущие данные для обучения. Перекрестная проверка с исключением по одному (LOO) не подходит для временных рядов из-за потенциальной утечки данных и вычислительной сложности. Однократное отложенное разбиение не обеспечивает достаточной надежности для настройки гиперпараметров, так как использует только одно разбиение для оценки.
Сдайте экзамен — без бесконечного поиска ответов
Получите все проверенные вопросы и объяснения для этого экзамена в одном месте и сэкономьте часы подготовки. 1000+ сертификаций · 20+ языков · начните бесплатно.
Сдайте экзамен быстрее → Карта не требуется