Amazon MLS-C01: Szeregi czasowe i prognozowanie — Przewodnik do nauki

Część AWS Machine Learning Specialty MLS-C01 — Przewodnik do nauki. Ćwicz ze zweryfikowanymi odpowiedziami w centrum egzaminów Amazon, albo rozwiąż testy na czas na ExamRoll.io.

Wybór algorytmu i kiedy stosować każde z podejść

Wybór odpowiedniego modelu prognostycznego zaczyna się od kształtu danych i celu. Klasyczne podejścia jednowymiarowe, takie jak ARIMA/SARIMA, pozostają właściwym wyborem, gdy mamy do czynienia z pojedynczym, dobrze ułożonym szeregiem z długą historią i interpretowalnymi składnikami sezonowymi; można je zaimplementować w skrypcie treningowym SageMaker przy użyciu statsmodels lub interaktywnie przeprowadzać eksperymenty w SageMaker Studio. Modele dekompozycyjne w stylu Prophet są cenne, gdy efekty świąteczne wynikające z działalności biznesowej i wielorakie sezonowości (dzienna/tygodniowa/roczna) muszą być jawnie modelowane i interpretowane; są one często prototypowane w notatnikach i mogą być wdrażane na produkcję w SageMaker. Do probabilistycznego prognozowania wielu szeregów na dużą skalę należy używać DeepAR (wbudowany algorytm SageMaker lub DeepAR+ w Amazon Forecast), który uczy się na powiązanych szeregach czasowych i generuje prognozy kwantylowe. Ważne wybory konfiguracyjne obejmują ustawienie time_freq, prediction_length i context_length (context_length powinno być zazwyczaj >= prediction_length), wybór odpowiedniej funkcji wiarygodności (rozkład studenta-T dla ciężkich ogonów, rozkład ujemny dwumianowy dla danych zliczeniowych/popytu sporadycznego) oraz włączenie use_feat_dynamic_real lub use_feat_static_cat dla kowariantów. Używaj modeli klasycznych, gdy wymagana jest interpretowalność i diagnostyka pojedynczego szeregu; preferuj DeepAR/Amazon Forecast, gdy masz wiele powiązanych szeregów i potrzebujesz skalibrowanych wyników probabilistycznych oraz wbudowanego skalowania.

Przygotowanie danych: sezonowość, kowarianty i brakujące wartości

Dobre prognozy wymagają starannego dopasowania znaczników czasu, częstotliwości i kowariantów. Zawsze normalizuj znaczniki czasu do spójnej strefy czasowej i częstotliwości (ustaw time_freq dla modeli). Uwzględnij znaną sezonowość i wydarzenia biznesowe, dodając wskaźniki świąt i cechy wydarzeń specjalnych jako statyczne lub dynamiczne kowarianty; dołącz promocje cenowe, otwarcia sklepów czy flagi kampanii jako cechy dynamiczne. Brakujące wartości muszą być obsługiwane w przemyślany sposób: dla krótkich przerw stosuj interpolację lub wypełnianie w przód/wstecz (forward/backward fill); dla dłuższych przerw stosuj imputację za pomocą metod modelowych lub maskuj je, gdy algorytm wspiera brakujące wartości (DeepAR akceptuje zamaskowane cechy dynamiczne). W przypadku popytu sporadycznego z wieloma zerami lub nadmiernie rozproszonych danych zliczeniowych, użyj ujemnej dwumianowej funkcji wiarygodności, eksperymentuj z agregacją (np. tygodniową), aby zmniejszyć rzadkość danych, lub zastosuj przetwarzanie wstępne oparte na metodzie Crostona, gdy odpowiednie są metody klasyczne. Unikaj wycieku przyszłych informacji w kowariantach — cechy dynamiczne muszą być znane lub prognozowalne dla horyzontu predykcji. Przechowuj metadane (item_id, category, store_id) jako statyczne cechy kategoryczne, aby umożliwić modelom wieloszeregowym dzielenie się informacją między produktami.

Ewaluacja: metryki probabilistyczne, backtesting i kalibracja

Prognozowanie probabilistyczne wymaga innych kryteriów oceny niż prognozy punktowe. Używaj funkcji straty kwantylowej (pinball loss) i ciągłego ważonego wyniku prawdopodobieństwa (CRPS), aby ocenić jakość rozkładu, oraz raportuj pokrycie dla kluczowych kwantyli (np. P50, P90), aby zweryfikować kalibrację przedziałów. Unikaj polegania wyłącznie na MAPE dla szeregów z zerami lub popytem sporadycznym; używaj Średniego Bezwzględnego Błędu Skalowanego (MASE) do porównań niezależnych od skali lub ważonych strat kwantylowych, aby priorytetyzować jednostki SKU o wysokich przychodach. Zaimplementuj walidację krzyżową z kroczącym początkiem (dla szeregów czasowych) z wieloma oknami backtestu, aby uchwycić niestabilność czasową i sezonowość, upewniając się, że każde okno respektuje cykle sezonowe, tak aby zbiory walidacyjne (holdout) zawierały pełne okresy sezonowe. Sprawdzaj kalibrację za pomocą wskaźników trafień przedziałów predykcyjnych i histogramów typu PIT; jeśli przedziały są zbyt wąskie, rozważ zwiększenie num_eval_samples w DeepAR lub dostosowanie założeń dotyczących funkcji wiarygodności. Częste pułapki obejmują używanie kowariantów znanych w przyszłości, które nie będą dostępne w momencie wnioskowania, agregowanie danych w sposób eliminujący kluczową sezonowość oraz ocenę na pojedynczym, statycznym zbiorze walidacyjnym, która nie uwzględnia zmian reżimu. Agreguj metryki dla poszczególnych szeregów według ich znaczenia biznesowego, a nie prostych średnich, aby odzwierciedlić wpływ na decyzje.

Skalowanie, wzorce wdrożeń i kryteria decyzyjne

Skalowanie prognozowania do tysięcy lub milionów szeregów czasowych i wdrażanie prognoz na produkcję wiąże się z kompromisami architektonicznymi. W przypadku zarządzanego rozwiązania nastawionego na skalowalność, Amazon Forecast obsługuje grupy zbiorów danych (docelowe szeregi czasowe, powiązane szeregi czasowe, metadane produktów), zautomatyzowaną inżynierię cech, wbudowany backtesting oraz elastyczne, hostowane predyktory do prognoz wsadowych lub eksportowalnych; jest to dobre rozwiązanie, gdy potrzebujesz usługi obsługującej wiele szeregów bez konieczności niestandardowego trenowania modeli. Dla potrzeb niestandardowego modelowania użyj SageMaker z DeepAR (lub niestandardowymi modelami PyTorch/TF), gdzie kontrolujesz hiperparametry, wybór funkcji wiarygodności (likelihood) i inżynierię cech; trenuj na instancjach GPU dla szybkości i używaj SageMaker Batch Transform do masowego wnioskowania lub endpointów czasu rzeczywistego do serwowania z niskim opóźnieniem. Dla efektywności kosztowej przy wielu wersjach modelu, rozważ endpointy wielomodelowe (multi-model endpoints) lub asynchroniczne potoki wsadowe wyzwalane przez zdarzenia S3 lub Step Functions. Kryteria decyzyjne obejmują to, czy potrzebujesz niestandardowych architektur (wybierz SageMaker), czy potrzebujesz uczenia na wielu szeregach (cross-series learning) przy minimalnym nakładzie operacyjnym (wybierz Forecast), oraz czy wymagane są prognozy dla pojedynczego szeregu z niskim opóźnieniem (preferuj endpointy czasu rzeczywistego SageMaker). Częste pułapki: niedostateczne alokowanie context_length, błędna konfiguracja wyników kwantylowych oraz nieuwzględnianie wpływu biznesowego przy ważeniu oceny.

Problem praktyczny: Scenariusz użycia

Scenariusz: Acme Retail prowadzi 5000 sklepów i przechowuje dzienne logi sprzedaży i promocji w Amazon S3. Używają SageMaker Studio do data science i potrzebują skalowalnych prognoz produkcyjnych do zarządzania zapasami i promocjami.

Wyzwanie: Stworzenie skalibrowanych, 30-dniowych probabilistycznych prognoz popytu dla każdej pary SKU-sklep, które uwzględniają święta i promocje, radzą sobie z okresową zerową sprzedażą dla wielu SKU i skalują się do nocnej produkcji wsadowej.

Zalecane podejście:

  1. Skonfiguruj potoki danych: pozyskuj dzienne dane o sprzedaży i promocjach do S3, skataloguj je za pomocą AWS Glue i udostępnij przez Athena; utwórz pliki zbioru danych z timestamp, item_id, store_id, target_value i cechami dynamicznymi.
  2. Stwórz prototypy modeli w SageMaker Studio: wypróbuj dekompozycję w stylu Prophet dla kilku reprezentatywnych SKU, a następnie wytrenuj SageMaker DeepAR (ustaw time_freq='D', prediction_length=30, context_length=30–90, likelihood='negative-binomial' dla danych zliczeniowych, num_eval_samples=100).
  3. Dla skalowania i produkcji: zaplanuj nocne trenowanie wsadowe lub przyrostowe dotrenowywanie w SageMaker (lub opcjonalnie użyj Amazon Forecast z grupami zbiorów danych i predyktorami, jeśli preferujesz zarządzane prognozy) i użyj SageMaker Batch Transform lub eksportu wsadowego z Forecast do nocnego masowego wnioskowania.
  4. Oceniaj za pomocą backtestów typu rolling-origin, używając metryk straty kwantylowej (quantile loss) i pokrycia (coverage) (P50/P90), i monitoruj kalibrację na żywo; jeśli przedziały nie pokrywają wystarczająco (under-cover), dostrój funkcję wiarygodności (likelihood) lub zwiększ num_eval_samples.

Uzasadnienie: Użycie Glue/Athena i S3 standaryzuje dostęp do danych, DeepAR (lub Forecast) natywnie modeluje wiele powiązanych szeregów i generuje kwantyle potrzebne do decyzji o zapasach, rozkład ujemny dwumianowy (negative-binomial) radzi sobie z okresowymi danymi zliczeniowymi, a transformacja wsadowa (batch transform) umożliwia efektywne kosztowo nocne skalowanie.


Przetwarzanie języka naturalnego i mowa · Wszystkie domeny · Trenowanie

Przećwicz te pytania → · Testy na czas na ExamRoll.io →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

Zdaj egzamin →

Przeglądaj Amazon →

Related guides

Dostęp all-in-one

Jedna subskrypcja. Każdy egzamin.

Każdy plan odblokowuje nieograniczone wyszukiwanie odpowiedzi, testy praktyczne, wyjaśnienia AI i pełną bibliotekę zasobów — w ponad 20 językach.

Miesięczny
24.87
Just €0.83/day
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

Najlepsza wartość
12 miesięcy
179.87
Just €0.49/daySave 40%
Wszystko w cenie:
  • Nieograniczone wyszukiwanie odpowiedzi
  • Nieograniczone testy praktyczne
  • Wyjaśnienia wspomagane AI
  • Pełna biblioteka zasobów
  • Ponad 20 języków
  • Cotygodniowe aktualizacje treści
  • Nagrody i polecenia
  • Priorytetowe wsparcie
Rozpocznij bezpłatny okres próbny

Karta kredytowa nie jest wymagana*

✓ Plan darmowy w zestawie · ✓ Anuluj w dowolnym momencie · ✓ Wszystkie plany odblokowują pełny produkt