Amazon MLS-C01: 時系列と予測 — 学習ガイド

こちらの一部です: AWS Machine Learning Specialty MLS-C01 — 学習ガイド. 検証済みの解答で練習: Amazon試験ハブ, または時間制限付き模擬試験に挑戦: ExamRoll.io.

アルゴリズムの選択と各アプローチの使い分け

適切な予測モデルの選択は、データの形状と目的から始まります。ARIMA/SARIMAのような古典的な単変量アプローチは、解釈可能な季節性項を持つ、挙動が安定した単一の長い時系列データがある場合に適しています。これらは、statsmodelsを使用してSageMakerのトレーニングスクリプトに実装するか、SageMaker Studioでインタラクティブに実験を実行できます。Prophetスタイルの分解モデルは、ビジネス主導の祝日効果や複数の季節性(日次/週次/年次)を明示的にモデル化し、解釈する必要がある場合に価値があります。これらは多くの場合、ノートブックでプロトタイプが作成され、SageMakerで本番稼働させることができます。大規模な確率的多系列予測には、関連する時系列を横断して学習し、分位点予測を生成するDeepAR(SageMaker組み込みアルゴリズムまたはAmazon ForecastのDeepAR+)を使用します。重要な設定の選択肢には、time_freqprediction_lengthcontext_lengthの設定(通常、context_lengthprediction_length以上であるべきです)、適切な尤度(裾の重い分布にはstudentT、カウントデータ/間欠需要にはnegative-binomial)の選択、共変量のためのuse_feat_dynamic_realまたはuse_feat_static_catの有効化が含まれます。解釈可能性と単一系列の診断が必要な場合は古典的なモデルを使用し、多数の関連系列があり、キャリブレーションされた確率的出力と組み込みのスケーリングが必要な場合はDeepAR/Amazon Forecastを選択します。

データ準備:季節性、共変量、欠損値

良い予測には、タイムスタンプ、頻度、共変量を注意深く整合させることが必要です。タイムスタンプは常に一貫したタイムゾーンと頻度に正規化します(モデルにはtime_freqを設定)。静的または動的な共変量として祝日インジケーターや特別イベントの特徴量を追加することで、既知の季節性やビジネスイベントを捉えます。価格プロモーション、店舗の開店、キャンペーンフラグなどを動的な特徴量として含めます。欠損値は慎重に処理する必要があります。短いギャップには補間または前方/後方補完を使用し、長いギャップにはモデルベースのアプローチで補完するか、アルゴリズムが欠損をサポートしている場合はマスクします(DeepARはマスクされた動的特徴量を受け入れます)。ゼロが多く含まれる間欠需要や過分散なカウントデータに対しては、negative-binomial尤度を使用し、スパース性を減らすために集計(例:週次)を試すか、古典的な手法が適切な場合にはCrostonベースの前処理を適用します。共変量に未来の情報がリークしないように注意してください。動的な特徴量は、予測期間において既知であるか、予測可能でなければなりません。メタデータ(item_idcategorystore_id)を静的なカテゴリカル特徴量として保存し、多系列モデルがアイテム間で情報を共有できるようにします。

評価:確率的メトリクス、バックテスト、キャリブレーション

確率的予測は、点予測とは異なる評価基準を必要とします。分位点損失(ピンボール損失)とCRPS(Continuous Ranked Probability Score)を使用して分布の品質を評価し、主要な分位点(例:P50、P90)のカバレッジを報告して、予測区間のキャリブレーションを検証します。ゼロや間欠需要を含む系列に対してMAPEのみに依存することは避け、スケールに依存しない比較のためにMASE(Mean Absolute Scaled Error)を使用するか、高収益のSKUを優先するために重み付き分位点損失を使用します。時間的な不安定性や季節性を捉えるために、複数のバックテストウィンドウを用いたローリングオリジン(時系列)交差検証を実装し、各ウィンドウが季節サイクルを尊重し、ホールドアウト期間が完全な季節期間を含むようにします。予測区間のヒット率やPIT(Probability Integral Transform)のようなヒストグラムでキャリブレーションを確認します。区間が狭すぎる場合は、DeepARのnum_eval_samplesを増やすか、尤度の仮定を調整することを検討します。よくある落とし穴には、推論時には利用できない未来の既知の共変量を使用すること、重要な季節性を集計によって失ってしまうこと、体制の変化を見逃す単一の静的なホールドアウトで評価することが含まれます。系列ごとのメトリクスは、単純な平均ではなく、ビジネス上の重要度で集計し、意思決定への影響を反映させます。

スケーリング、デプロイパターン、および意思決定基準

数千から数百万の系列に予測をスケーリングし、本番環境に予測をデプロイするには、アーキテクチャ上のトレードオフが伴います。マネージドでスケールファーストなソリューションとしては、Amazon Forecastがデータセットグループ(ターゲット時系列、関連時系列、アイテムメタデータ)、自動化された特徴量エンジニアリング、組み込みのバックテスト、およびバッチ予測またはエクスポート可能な予測のための伸縮自在なホスト型予測子を処理します。これは、オーダーメイドのモデルトレーニングなしで多くの系列を処理するサービスが必要な場合に非常に適しています。カスタムモデリングのニーズには、SageMakerとDeepAR(またはカスタムのPyTorch/TFモデル)を使用します。これにより、ハイパーパラメータ、尤度の選択、特徴量エンジニアリングを制御できます。速度向上のためにGPUインスタンスでトレーニングし、一括推論にはSageMakerバッチ変換を、低レイテンシーのサービングにはリアルタイムエンドポイントを使用します。多くのモデルバージョンでコスト効率を高めるには、マルチモデルエンドポイントや、S3イベントまたはStep Functionsによってトリガーされる非同期バッチパイプラインを検討してください。意思決定基準には、カスタムアーキテクチャが必要かどうか(SageMakerを選択)、最小限の運用で系列間の学習が必要かどうか(Forecastを選択)、低レイテンシーの単一系列予測が必要かどうか(SageMakerリアルタイムエンドポイントを優先)が含まれます。よくある落とし穴:context_lengthの過小なプロビジョニング、分位点出力の設定ミス、ビジネスインパクトによる評価の重み付けの欠如。

実践的な問題:ユースケースシナリオ

シナリオ: Acme Retailは5,000店舗を運営し、日々の売上およびプロモーションログをAmazon S3に保存しています。データサイエンスにはSageMaker Studioを使用しており、在庫管理とプロモーション活動を推進するためにスケーラブルな本番予測が必要です。

課題: SKUと店舗のペアごとに、休日やプロモーションを考慮し、多くのSKUで発生する断続的なゼロ売上に対応し、夜間のバッチ本番処理にスケールする、キャリブレーションされた30日間の確率的需要予測を生成すること。

推奨アプローチ:

  1. データパイプラインの設定:日々の売上とプロモーションをS3に取り込み、AWS Glueでカタログ化し、Athena経由で公開します。timestampitem_idstore_idtarget_value、および動的特徴量を含むデータセットファイルを作成します。
  2. SageMaker Studioでのモデルのプロトタイピング:いくつかの代表的なSKUでProphetスタイルの分解を試し、次にSageMaker DeepARをトレーニングします(time_freq='D'prediction_length=30context_length=30–90、カウントデータに対してlikelihood='negative-binomial'num_eval_samples=100と設定)。
  3. スケールと本番環境向け:SageMakerで夜間のバッチトレーニングまたは増分再トレーニングをスケジュールし(オプションとして、マネージドな予測を好む場合はAmazon Forecastのデータセットグループと予測子を使用)、夜間の一括推論にはSageMakerバッチ変換またはForecastバッチエクスポートを使用します。
  4. 評価と監視:分位点損失とカバレッジメトリクス(P50/P90)を使用してローリングオリジンバックテストで評価し、ライブでのキャリブレーションを監視します。予測区間が実績値を十分にカバーしない場合(under-cover)、尤度を調整するか、num_eval_samplesを増やします。

論理的根拠: Glue/AthenaとS3を使用することでデータアクセスが標準化されます。DeepAR(またはForecast)は多くの関連系列をネイティブにモデル化し、在庫決定に必要な分位点を出力します。負の二項分布(negative-binomial)は断続的なカウントデータを処理し、バッチ変換はコスト効率の良い夜間スケーリングを可能にします。


自然言語処理と音声 · すべてのドメイン · トレーニング、分散トレーニングとハイパーパラメータ最適化

これらの問題を練習する → · ExamRoll.ioで時間制限付き練習 →

Pass the whole exam — not just this question

You found this answer. Get every verified question and explanation in one place, and save hours of prep. Free to start.

試験に合格する →

Amazonを閲覧 →

Related guides

オールインワンアクセス

1つのサブスクリプション。すべての試験。

すべてのプランで、無制限の回答検索、模擬試験、AI解説、および完全なリソースライブラリが利用可能 — 20以上の言語に対応。

月額
24.87
Just €0.83/day
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

ベストバリュー
12ヶ月
179.87
Just €0.49/daySave 40%
すべて含まれています:
  • 無制限の回答検索
  • 無制限の模擬試験
  • AIを活用した解説
  • 完全なリソースライブラリ
  • 20以上の言語
  • 毎週のコンテンツ更新
  • 特典 & 紹介
  • 優先サポート
無料トライアルを開始

クレジットカード不要*

✓ 無料プランが含まれています · ✓ いつでもキャンセル可能 · ✓ すべてのプランで製品の全機能が利用可能