PowerGrid Inc は、S3 データレイクに保存されている複数年にわたる時間ごとの電力負荷を予測するモデルをトレーニングし、特徴量エンジニアリングに SageMaker Processing ジョブを使用しています。チームは、SageMaker でのハイパーパラメータチューニング中に標準の k-fold (scikit-learn KFold with shuffle=False) 交差検定を使用することを検討しましたが、時間的リーケージを懸念しています。堅牢なハイパーパラメータチューニングをサポートしながらリーケージを回避するための最良の検証戦略と SageMaker 統合は何ですか?
解答を選択
オプションをタップして解答を確認してください。
正解: 複数の SageMaker Training ジョブ (フォールドごとに 1 つ) または SageMaker Processing ベースのオーケストレーションとして実装されたウォークフォワード (ローリングオリジン) 検証を実装し、各フォールドが過去のデータのみでトレーニングし、将来のウィンドウで検証するようにします。.
これが解答である理由
時系列データでは、将来のデータがトレーニングセットに含まれると時間的リーケージが発生し、モデルのパフォーマンスが過大評価される可能性があります。ウォークフォワード(ローリングオリジン)検証は、各フォールドが過去のデータのみでトレーニングされ、将来のウィンドウで検証されるため、このリーケージを防ぐことができます。これは、SageMaker Training ジョブを複数使用するか、SageMaker Processing をオーケストレーションに利用して実装できます。 誤った選択肢: k-fold CV (shuffle=False) は順序を保持しますが、時系列の依存関係を完全に考慮できず、時間的リーケージのリスクが残ります。 Leave-one-out cross-validation (LOO) は計算コストが高く、時系列データの長期的な依存関係を捉えるには不向きです。 単一のホールドアウト検証は、ハイパーパラメータチューニングのための堅牢な評価を提供せず、モデルの汎化性能を過小評価または過大評価する可能性があります。
試験に合格 — 終わりのない解答探しなしで
この試験のすべての検証済み問題と解説を1か所で入手し、準備時間を大幅に節約しましょう。1,000以上の認定 · 20以上の言語 · 無料で開始。
試験に早く合格する → カード不要