PowerGrid Inc는 S3 데이터 레이크에 저장된 수년간의 시간별 전력 부하를 예측하는 모델을 훈련하고 SageMaker Processing 작업을 사용하여 특징 엔지니어링을 수행합니다. 팀은 SageMaker에서 하이퍼파라미터 튜닝 중에 표준 k-겹(scikit-learn KFold with shuffle=False) 교차 검증을 사용하는 것을 고려했지만, 시간적 누출(temporal leakage)에 대해 우려하고 있습니다. 강력한 하이퍼파라미터 튜닝을 지원하면서 누출을 방지하기 위한 최상의 검증 전략과 SageMaker 통합은 무엇입니까?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 여러 SageMaker Training 작업(폴드당 하나) 또는 SageMaker Processing 기반 오케스트레이션으로 구현된 walk-forward(rolling-origin) 검증을 구현하여 각 폴드가 과거 데이터로만 훈련하고 미래 윈도우에서 검증하도록 합니다..
이것이 정답인 이유
정답은 walk-forward(rolling-origin) 검증을 구현하는 것입니다. 시계열 데이터의 경우 미래 데이터가 훈련 세트에 포함되어 모델이 미래 정보를 "미리 보는" 시간적 누출을 방지하는 것이 중요합니다. Walk-forward 검증은 각 폴드가 과거 데이터로만 훈련하고 미래 데이터로 검증하도록 하여 이를 방지합니다. 이는 SageMaker Training 작업 또는 Processing 작업을 사용하여 구현할 수 있습니다. 오답 설명: 표준 k-겹 CV는 shuffle=False로 설정해도 시간적 순서를 보존하지 못하며, 미래 데이터가 훈련 세트에 포함될 수 있어 시간적 누출이 발생합니다. LOO(leave-one-out cross-validation)는 계산 비용이 매우 높고, 시계열 데이터의 시간적 종속성을 적절히 처리하지 못합니다. 단일 홀드아웃 검증은 하이퍼파라미터 튜닝에 충분히 강력하지 않으며, 단일 분할에 과적합될 위험이 있습니다.
끝없는 정답 찾기 없이 시험 합격
이 시험에 대한 모든 검증된 문제와 설명을 한곳에서 얻고, 준비 시간을 몇 시간 절약하세요. 1,000개 이상의 자격증 · 20개 이상의 언어 · 무료로 시작.
더 빠르게 시험 합격 → 카드 필요 없음