Amazon MLS-C01: Tijdreeksen & Voorspellen — Studiegids
Onderdeel van de AWS Machine Learning Specialty MLS-C01 — Studiegids. Oefen met geverifieerde antwoorden in het Amazon-examencentrum, of doe getimede oefentests op ExamRoll.io.
Algoritme-selectie en wanneer elke aanpak te gebruiken
Het kiezen van het juiste forecastingmodel begint bij de vorm van de data en het doel. Klassieke univariate benaderingen zoals ARIMA/SARIMA blijven de juiste keuze wanneer je een enkele, goed gedefinieerde tijdreeks hebt met een lange historie en interpreteerbare seizoensgebonden termen; je kunt deze implementeren in een SageMaker-trainingsscript met behulp van statsmodels of interactief experimenten uitvoeren in SageMaker Studio. Decomposeerbare modellen in de stijl van Prophet zijn waardevol wanneer door de business gedreven feestdageffecten en meervoudige seizoensinvloeden (dagelijks/wekelijks/jaarlijks) expliciet gemodelleerd en geïnterpreteerd moeten worden; deze worden vaak als prototype ontwikkeld in notebooks en kunnen in productie worden genomen in SageMaker. Voor probabilistische, multi-series forecasting op grote schaal, gebruik je DeepAR (een ingebouwd algoritme van SageMaker of DeepAR+ van Amazon Forecast), dat leert over gerelateerde tijdreeksen en kwantielvoorspellingen produceert. Belangrijke configuratiekeuzes zijn onder meer het instellen van time_freq, prediction_length en context_length (context_length moet doorgaans >= prediction_length zijn), het kiezen van een geschikte likelihood (studentT voor heavy tails, negative-binomial voor tellingen/intermitterende vraag), en het inschakelen van use_feat_dynamic_real of use_feat_static_cat voor covariaten. Gebruik klassieke modellen wanneer interpreteerbaarheid en diagnostiek voor enkele tijdreeksen vereist zijn; geef de voorkeur aan DeepAR/Amazon Forecast wanneer je veel gerelateerde tijdreeksen hebt en gekalibreerde probabilistische output en ingebouwde schaalbaarheid nodig hebt.
Datavoorbereiding: seizoensinvloeden, covariaten en ontbrekende waarden
Goede voorspellingen vereisen een zorgvuldige afstemming van timestamps, frequentie en covariaten. Normaliseer timestamps altijd naar een consistente tijdzone en frequentie (stel time_freq in voor modellen). Leg bekende seizoensinvloeden en zakelijke evenementen vast door indicatoren voor feestdagen en speciale gebeurtenissen toe te voegen als statische of dynamische covariaten; neem prijspromoties, winkelopeningen of campagnevlaggen op als dynamische features. Ontbrekende waarden moeten zorgvuldig worden behandeld: gebruik voor korte hiaten interpolatie of forward/backward fill; gebruik voor langere hiaten imputatie met modelgebaseerde benaderingen of maskeer ze wanneer het algoritme ontbrekende waarden ondersteunt (DeepAR accepteert gemaskeerde dynamische features). Voor intermitterende vraag met veel nullen of overgedispergeerde tellingen, gebruik je de negative-binomial likelihood, experimenteer je met aggregatie (bijv. wekelijks) om de sparsiteit te verminderen, of pas je op Croston gebaseerde preprocessing toe wanneer klassieke methoden geschikt zijn. Voorkom het lekken van toekomstige informatie in covariaten—dynamische features moeten bekend of voorspelbaar zijn voor de voorspellingshorizon. Sla metadata (item_id, category, store_id) op als statische categorische features zodat multi-series modellen kennis kunnen delen tussen items.
Evaluatie: probabilistische metrieken, backtesting en kalibratie
Probabilistische forecasting vereist andere evaluatiecriteria dan puntvoorspellingen. Gebruik quantile loss (pinball loss) en de continuous ranked probability score (CRPS) om de distributionele kwaliteit te evalueren, en rapporteer de dekking (coverage) voor belangrijke kwantielen (bijv. P50, P90) om de intervalkalibratie te verifiëren. Vermijd het uitsluitend vertrouwen op MAPE voor tijdreeksen met nullen of intermitterende vraag; gebruik Mean Absolute Scaled Error (MASE) voor schaal-invariante vergelijking of gewogen kwantielverliezen (weighted quantile losses) om SKU’s met een hoge omzet te prioriteren. Implementeer rolling-origin (tijdreeks) cross-validatie met meerdere backtest-vensters om temporele instabiliteit en seizoensinvloeden vast te leggen, en zorg ervoor dat elk venster de seizoenscycli respecteert zodat holdouts volledige seizoensperioden bevatten. Controleer de kalibratie met de ‘hit rates’ van voorspellingsintervallen en PIT-achtige histogrammen; als de intervallen te smal zijn, overweeg dan om num_eval_samples in DeepAR te verhogen of de aannames over de likelihood aan te passen. Veelvoorkomende valkuilen zijn het gebruik van covariaten die in de toekomst bekend zijn maar niet beschikbaar zullen zijn tijdens inferentie, het weg-aggregeren van kritieke seizoensinvloeden, en het evalueren op een enkele statische holdout-set die regimeveranderingen mist. Aggregeer metrieken per tijdreeks op basis van zakelijk belang in plaats van simpele gemiddelden om de impact op beslissingen te weerspiegelen.
Schalen, implementatiepatronen en beslissingscriteria
Het schalen van forecasting naar duizenden of miljoenen tijdreeksen en het in productie nemen van voorspellingen brengt architecturale afwegingen met zich mee. Voor een beheerde, op schaal gerichte oplossing, beheert Amazon Forecast datasetgroepen (doeltijdreeksen, gerelateerde tijdreeksen, item-metadata), geautomatiseerde feature engineering, ingebouwde backtesting en elastische gehoste predictors voor batch- of exporteerbare voorspellingen; het is zeer geschikt als u een service wilt die veel reeksen aankan zonder op maat gemaakte modeltraining. Voor aangepaste modelleringsbehoeften, gebruik SageMaker met DeepAR (of aangepaste PyTorch/TF-modellen) waar u de controle hebt over hyperparameters, likelihood-keuzes en feature engineering; train op GPU-instances voor snelheid en gebruik SageMaker Batch Transform voor bulk-inferentie of real-time endpoints voor serving met lage latentie. Voor kostenefficiëntie met veel modelversies, overweeg multi-model endpoints of asynchrone batch-pipelines die worden getriggerd door S3-events of Step Functions. Beslissingscriteria omvatten of u aangepaste architecturen nodig heeft (kies SageMaker), of u cross-series learning nodig heeft met minimale operationele overhead (kies Forecast), en of voorspellingen voor één enkele reeks met lage latentie vereist zijn (geef de voorkeur aan SageMaker real-time endpoints). Veelvoorkomende valkuilen: het te krap instellen van context_length, het verkeerd configureren van kwantiel-outputs en het niet wegen van de evaluatie op basis van bedrijfsimpact.
Praktijkprobleem: Use-Case Scenario
Scenario: Acme Retail heeft 5.000 winkels en houdt dagelijkse verkoop- en promotielogs bij in Amazon S3. Ze gebruiken SageMaker Studio voor data science en hebben schaalbare productieprognoses nodig om voorraad en promoties aan te sturen.
Uitdaging: Produceer gekalibreerde 30-daagse probabilistische vraagvoorspellingen per SKU-winkelcombinatie die rekening houden met feestdagen en promoties, omgaan met intermitterende nulverkopen voor veel SKU’s, en schaalbaar zijn voor nachtelijke batchproductie.
Aanbevolen Aanpak:
- Configureer datapijplijnen: ingest dagelijkse verkoop- en promotiegegevens in S3, catalogiseer met AWS Glue en ontsluit via Athena; maak datasetbestanden aan met timestamp, item_id, store_id, target_value en dynamische features.
- Prototypeer modellen in SageMaker Studio: probeer Prophet-stijl decompositie voor enkele representatieve SKU’s, train vervolgens SageMaker DeepAR (stel
time_freq='D',prediction_length=30,context_length=30–90,likelihood='negative-binomial'voor tellingen,num_eval_samples=100in). - Voor schaal en productie: plan nachtelijke batch-training of incrementele hertraining in SageMaker (of gebruik optioneel Amazon Forecast met datasetgroepen en predictors als u de voorkeur geeft aan beheerde voorspellingen), en gebruik SageMaker Batch Transform of Forecast batch-export voor nachtelijke bulk-inferentie.
- Evalueer met rolling-origin backtests met behulp van quantile loss en dekkingsstatistieken (P50/P90), en monitor de live kalibratie; als de intervallen onvoldoende dekking bieden, pas dan de likelihood aan of verhoog
num_eval_samples.
Redenering: Het gebruik van Glue/Athena en S3 standaardiseert de datatoegang, DeepAR (of Forecast) modelleert van nature veel gerelateerde reeksen en produceert de kwantielen die nodig zijn voor voorraadbeslissingen, negative-binomial kan omgaan met intermitterende tellingen, en batch transform maakt kosteneffectieve nachtelijke schaling mogelijk.
← Natural Language Processing · Alle domeinen · Training →
Oefen deze vragen → · Getimede oefening op ExamRoll.io →
Pass the whole exam — not just this question
You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.
Slaag voor je examen →