한 금융 회사가 일별 과거 데이터를 사용하여 상품 가격을 예측해야 합니다. 데이터 과학자는 데이터 세트의 80%로 모델을 훈련하고 나머지 20%로 검증해야 합니다. 시계열 예측에 대한 모델 비교가 유효하도록 데이터를 어떻게 분할해야 할까요?
정답 선택
옵션을 탭하여 정답을 확인하세요.
정답: 80%의 데이터 포인트가 해당 날짜 이전에 발생하도록 마감 날짜를 선택합니다. 이 이전 포인트를 훈련에 사용하고 나머지 이후 포인트를 검증에 사용합니다..
이것이 정답인 이유
시계열 데이터는 시간적 순서가 중요하므로, 모델이 미래를 예측하는 능력을 평가하려면 훈련 데이터는 검증 데이터보다 시간적으로 선행해야 합니다. 따라서 전체 데이터의 80%를 차지하는 특정 시점까지의 데이터를 훈련에 사용하고, 그 이후의 20% 데이터를 검증에 사용해야 합니다. 이는 모델이 훈련 시점에 알지 못했던 미래 데이터를 예측하는 시나리오를 시뮬레이션하여 모델의 일반화 성능을 정확하게 평가할 수 있도록 합니다. 다른 옵션들은 시간적 순서를 무시하거나, 미래 데이터를 훈련에 사용하거나, 무작위 샘플링을 통해 시계열 데이터의 핵심 속성을 훼손하므로 올바른 모델 평가를 방해합니다.