Amazon MLS-C01: 시계열 및 예측 — 학습 가이드

다음의 일부입니다: AWS Machine Learning Specialty MLS-C01 — 학습 가이드. 검증된 답안으로 연습하기: Amazon 시험 허브, 또는 다음에서 시간 제한 모의고사 풀기: ExamRoll.io.

알고리즘 선택 및 접근 방식별 사용 사례

올바른 예측 모델을 선택하는 것은 데이터의 형태와 목표를 파악하는 것에서 시작됩니다. ARIMA/SARIMA와 같은 고전적인 단변량 접근 방식은 해석 가능한 계절성 항을 포함하고 이력이 긴 단일 시계열 데이터에 적합합니다. statsmodels를 사용하여 SageMaker 훈련 스크립트에서 이를 구현하거나 SageMaker Studio에서 대화형으로 실험을 실행할 수 있습니다. Prophet 스타일의 분해 가능 모델은 비즈니스 기반의 휴일 효과와 여러 계절성(일별/주별/연간)을 명시적으로 모델링하고 해석해야 할 때 유용합니다. 이러한 모델은 주로 노트북에서 프로토타입을 제작하며 SageMaker에서 프로덕션 환경에 배포할 수 있습니다. 대규모 확률적 다중 시계열 예측을 위해서는 관련 시계열 전반에 걸쳐 학습하고 분위수 예측을 생성하는 DeepAR(SageMaker 내장 알고리즘 또는 Amazon Forecast의 DeepAR+)를 사용하십시오. 주요 구성 선택 사항에는 time_freq, prediction_length, context_length 설정(일반적으로 context_length >= prediction_length), 적절한 우도(likelihood) 선택(heavy tail 분포에는 studentT, 카운트/간헐적 수요에는 negative-binomial), 공변량을 위한 use_feat_dynamic_real 또는 use_feat_static_cat 활성화 등이 포함됩니다. 해석 가능성과 단일 시계열 진단이 필요할 때는 고전적인 모델을 사용하고, 관련된 시계열이 많고 보정된 확률적 출력과 내장된 스케일링 기능이 필요할 때는 DeepAR/Amazon Forecast를 선호하는 것이 좋습니다.

데이터 준비: 계절성, 공변량, 결측값

좋은 예측을 위해서는 타임스탬프, 빈도, 공변량을 신중하게 정렬해야 합니다. 항상 타임스탬프를 일관된 시간대와 빈도로 정규화하십시오(모델에 time_freq 설정). 정적 또는 동적 공변량으로 휴일 지표와 특별 이벤트 피처를 추가하여 알려진 계절성과 비즈니스 이벤트를 포착하십시오. 가격 프로모션, 매장 오픈, 캠페인 플래그 등을 동적 피처로 포함시키십시오. 결측값은 신중하게 처리해야 합니다. 짧은 공백은 보간법이나 이전/이후 값으로 채우고(forward/backward fill), 긴 공백은 모델 기반 접근 방식으로 대체(imputation)하거나 알고리즘이 결측을 지원하는 경우 마스킹합니다(DeepAR은 마스킹된 동적 피처를 허용함). 0이 많거나 과대산포된 카운트가 있는 간헐적 수요의 경우, negative-binomial 우도를 사용하거나, 희소성을 줄이기 위해 집계(예: 주별)를 실험하거나, 고전적인 방법이 적절할 때 Croston 기반 전처리를 적용하십시오. 공변량에 미래 정보가 유출되지 않도록 주의해야 합니다. 동적 피처는 예측 기간 동안 알려져 있거나 예측 가능해야 합니다. 메타데이터(item_id, category, store_id)를 정적 범주형 피처로 저장하여 다중 시계열 모델이 여러 아이템 간에 정보를 공유하도록 하십시오.

평가: 확률적 지표, 백테스팅, 보정

확률적 예측은 단일 값 예측(point forecast)과는 다른 평가 기준을 필요로 합니다. 분포 품질을 평가하기 위해 분위수 손실(quantile loss, pinball loss)과 CRPS(continuous ranked probability score)를 사용하고, 구간 보정을 확인하기 위해 주요 분위수(예: P50, P90)에 대한 커버리지를 보고하십시오. 0이 포함되거나 간헐적인 수요가 있는 시계열에 대해 MAPE에만 의존하지 마십시오. 척도에 무관한 비교를 위해 MASE(Mean Absolute Scaled Error)를 사용하거나, 수익성이 높은 SKU에 우선순위를 두기 위해 가중 분위수 손실(weighted quantile loss)을 사용하십시오. 시간적 불안정성과 계절성을 포착하기 위해 여러 백테스트 기간을 사용하여 롤링 오리진(시계열) 교차 검증을 구현하고, 각 기간이 계절성 주기를 존중하여 홀드아웃 세트에 전체 계절 기간이 포함되도록 하십시오. 예측 구간 적중률과 PIT 유사 히스토그램으로 보정을 확인하십시오. 구간이 너무 좁으면 DeepAR에서 num_eval_samples를 늘리거나 우도 가정을 조정하는 것을 고려하십시오. 일반적인 함정으로는 추론 시점에는 사용할 수 없는 미래 정보를 담은 공변량 사용, 중요한 계절성을 제거하는 집계, 체제 변화를 놓치는 단일 고정 홀드아웃 세트에서의 평가 등이 있습니다. 의사 결정에 미치는 영향을 반영하기 위해, 시계열별 지표를 단순 평균이 아닌 비즈니스 중요도에 따라 집계하십시오.

확장, 배포 패턴 및 결정 기준

수천 또는 수백만 개의 시계열로 예측을 확장하고 예측을 프로덕션에 배포하는 데에는 아키텍처 상의 트레이드오프가 있습니다. 관리형, 확장 우선(scale-first) 솔루션의 경우, Amazon Forecast는 데이터 세트 그룹(대상 시계열, 관련 시계열, 항목 메타데이터), 자동화된 피처 엔지니어링, 내장된 백테스팅, 배치 또는 내보내기 가능한 예측을 위한 탄력적인 호스팅 예측기(predictor)를 처리합니다. 이 서비스는 맞춤형 모델 훈련 없이 많은 시계열을 처리하고자 할 때 매우 적합합니다. 사용자 지정 모델링 요구 사항의 경우, SageMaker와 DeepAR(또는 사용자 지정 PyTorch/TF 모델)을 사용하면 하이퍼파라미터, 가능도(likelihood) 선택, 피처 엔지니어링을 제어할 수 있습니다. 속도를 위해 GPU 인스턴스에서 훈련하고, 대량 추론을 위해 SageMaker Batch Transform을 사용하거나, 짧은 지연 시간의 서빙을 위해 실시간 엔드포인트를 사용합니다. 많은 모델 버전으로 비용 효율성을 높이려면, S3 이벤트나 Step Functions에 의해 트리거되는 다중 모델 엔드포인트 또는 비동기 배치 파이프라인을 고려하십시오. 결정 기준에는 사용자 지정 아키텍처가 필요한지(SageMaker 선택), 최소한의 운영으로 교차 시계열 학습이 필요한지(Forecast 선택), 짧은 지연 시간의 단일 시계열 예측이 필요한지(SageMaker 실시간 엔드포인트 선호) 등이 포함됩니다. 일반적인 함정: context_length를 불충분하게 프로비저닝하거나, 분위수(quantile) 출력을 잘못 구성하거나, 비즈니스 영향에 따라 평가에 가중치를 부여하지 않는 것입니다.

실용적인 문제: 사용 사례 시나리오

시나리오: Acme Retail은 5,000개의 매장을 운영하며 일일 판매 및 프로모션 로그를 Amazon S3에 유지 관리합니다. 데이터 과학을 위해 SageMaker Studio를 사용하며, 재고 및 프로모션을 관리하기 위해 확장 가능한 프로덕션 예측이 필요합니다.

과제: 휴일과 프로모션을 고려하고, 많은 SKU의 간헐적인 제로 판매(zero sales)를 처리하며, 야간 배치 프로덕션으로 확장할 수 있는 SKU-매장 쌍별로 보정된 30일 확률적 수요 예측을 생성합니다.

권장 접근 방식:

  1. 데이터 파이프라인 구성: 일일 판매 및 프로모션 데이터를 S3에 수집하고, AWS Glue로 카탈로그화한 후 Athena를 통해 노출합니다. timestamp, item_id, store_id, target_value 및 동적 피처를 포함하는 데이터 세트 파일을 생성합니다.
  2. SageMaker Studio에서 모델 프로토타입 제작: 몇 개의 대표적인 SKU에 대해 Prophet 스타일의 분해를 시도한 다음, SageMaker DeepAR을 훈련시킵니다(계산(counts)에 대해 time_freq='D', prediction_length=30, context_length=30–90, likelihood='negative-binomial', num_eval_samples=100으로 설정).
  3. 확장 및 프로덕션용: SageMaker에서 야간 배치 훈련 또는 증분 재훈련을 예약하고(또는 관리형 예측을 선호하는 경우 선택적으로 데이터 세트 그룹 및 예측기(predictor)와 함께 Amazon Forecast 사용), 야간 대량 추론을 위해 SageMaker Batch Transform 또는 Forecast 배치 내보내기를 사용합니다.
  4. 분위수 손실(quantile loss) 및 커버리지 지표(P50/P90)를 사용하여 롤링 오리진 백테스트(rolling-origin backtest)로 평가하고, 실시간 보정(live calibration)을 모니터링합니다. 만약 구간이 실제 값을 충분히 포함하지 못하면(under-cover), 가능도(likelihood)를 조정하거나 num_eval_samples를 늘립니다.

근거: Glue/Athena와 S3를 사용하면 데이터 액세스가 표준화되고, DeepAR(또는 Forecast)은 기본적으로 많은 관련 시계열을 모델링하고 재고 결정에 필요한 분위수(quantile)를 생성하며, negative-binomial은 간헐적인 계산(counts)을 처리하고, 배치 변환(batch transform)은 비용 효율적인 야간 확장을 가능하게 합니다.


자연어 처리 및 음성 · 모든 도메인 · 훈련

이 문제 연습하기 → · ExamRoll.io에서 시간 제한 연습 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

시험 합격하기 →

Amazon 찾아보기 →

Related guides

올인원 액세스

하나의 구독. 모든 시험.

모든 플랜은 무제한 답변 검색, 모의고사, AI 해설, 전체 자료 라이브러리를 20개 이상의 언어로 잠금 해제합니다.

월간
24.87
Just €0.83/day
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

최고의 가치
12개월
179.87
Just €0.49/daySave 40%
모든 포함:
  • 무제한 답변 검색
  • 무제한 모의고사
  • AI 기반 해설
  • 전체 자료 라이브러리
  • 20개 이상의 언어
  • 주간 콘텐츠 업데이트
  • 보상 및 추천
  • 우선 지원
무료 체험 시작

신용카드 필요 없음*

✓ 무료 플랜 포함 · ✓ 언제든지 취소 가능 · ✓ 모든 플랜은 전체 제품을 잠금 해제합니다